Agent Reliability / Research Project
DiagAgent
可靠 GUI Agent 运行框架
Reliable GUI Agent Runtime
面向专业 GUI 环境的可靠智能体运行框架,研究 Agent 执行失败后的诊断、验证和恢复机制。
01 / 项目定位
为什么做这个项目
面向专业 GUI 环境的可靠智能体运行框架,研究 Agent 执行失败后的诊断、验证和恢复机制。
02 / 背景与问题
问题从哪里开始
- 01
GUI Agent 可以执行操作,但失败时通常无法说明哪里发生了偏离。
- 02
最终产物看起来正确,不能单独证明中间过程和恢复结果可信。
- 03
恢复动作需要明确证据、范围和尝试次数,避免无边界重试。
03 / 架构
系统如何工作
- 01Task用户任务
明确目标、约束与验收条件
- 02Agent Planner智能体规划器
把任务拆成可执行步骤
- 03Action Executor动作执行器
在受控边界内调用 GUI 操作
- 04GUI EnvironmentGUI 环境
接收动作并产生状态变化
- 05Trace Collector轨迹采集器
记录步骤、状态与执行反馈
- 06Evidence Analyzer证据分析器
定位 first failure 与支持证据
- 07Verifier验证器
独立检查过程、任务与产物
- 08Recovery Module恢复模块
在 guard 约束下修复或停止
04 / 方法与贡献
如何解决问题
方法
- 记录执行轨迹与产物证据,定位观察到的 first failure。
- 由证据生成受约束的恢复策略,并只执行一次明确的恢复尝试。
- 使用独立验证和 fresh replay 判断任务是否真正恢复。
研究贡献
- Failure Diagnosis失败诊断
回答哪里失败以及为什么失败。
- Execution Evidence执行证据
让轨迹和产物成为可审计记录。
- Result Verification结果验证
独立确认恢复是否满足任务要求。
- Recovery Strategy恢复策略
限制修复类型、范围与尝试预算。
05 / 技术实现
使用什么技术
06 / 阶段成果
目前完成情况
受控真实 GIMP 评估已完成,研究记录与复现实验持续整理中。
- 01
Runtime contract 已完成
- 02
受控真实 GIMP cohort 已记录
- 03
Replay verification 与研究材料持续整理
已有证据
在冻结协议下的三个注册 GIMP 案例中,B0 不修复为 0/3,B1 朴素重试为 2/3,B2 DiagAgent 为 3/3。实验使用同一 resize 任务、固定 GIMP profile、确定性 oracle scaffold、fresh replay 和一次明确恢复尝试。
适用范围
这是小规模受控评估,不代表自主 LLM 规划、跨应用泛化或通用自愈能力。架构图表达职责分工,不代表已验证通用规划器。