GYC.
← 返回项目档案

Agent Reliability / Research Project

DiagAgent

可靠 GUI Agent 运行框架

Reliable GUI Agent Runtime

面向专业 GUI 环境的可靠智能体运行框架,研究 Agent 执行失败后的诊断、验证和恢复机制。

  • Agent Runtime
  • GUI Agent
  • Trace
  • Evidence
  • Evaluation

01 / 项目定位

为什么做这个项目

面向专业 GUI 环境的可靠智能体运行框架,研究 Agent 执行失败后的诊断、验证和恢复机制。

02 / 背景与问题

问题从哪里开始

  • 01

    GUI Agent 可以执行操作,但失败时通常无法说明哪里发生了偏离。

  • 02

    最终产物看起来正确,不能单独证明中间过程和恢复结果可信。

  • 03

    恢复动作需要明确证据、范围和尝试次数,避免无边界重试。

03 / 架构

系统如何工作

  1. 01
    Task用户任务

    明确目标、约束与验收条件

  2. 02
    Agent Planner智能体规划器

    把任务拆成可执行步骤

  3. 03
    Action Executor动作执行器

    在受控边界内调用 GUI 操作

  4. 04
    GUI EnvironmentGUI 环境

    接收动作并产生状态变化

  5. 05
    Trace Collector轨迹采集器

    记录步骤、状态与执行反馈

  6. 06
    Evidence Analyzer证据分析器

    定位 first failure 与支持证据

  7. 07
    Verifier验证器

    独立检查过程、任务与产物

  8. 08
    Recovery Module恢复模块

    在 guard 约束下修复或停止

04 / 方法与贡献

如何解决问题

方法

  • 记录执行轨迹与产物证据,定位观察到的 first failure。
  • 由证据生成受约束的恢复策略,并只执行一次明确的恢复尝试。
  • 使用独立验证和 fresh replay 判断任务是否真正恢复。

研究贡献

  • Failure Diagnosis失败诊断

    回答哪里失败以及为什么失败。

  • Execution Evidence执行证据

    让轨迹和产物成为可审计记录。

  • Result Verification结果验证

    独立确认恢复是否满足任务要求。

  • Recovery Strategy恢复策略

    限制修复类型、范围与尝试预算。

05 / 技术实现

使用什么技术

  • Python
  • GUI Agent
  • Runtime
  • Trace
  • Benchmark
  • Evaluation

06 / 阶段成果

目前完成情况

受控真实 GIMP 评估已完成,研究记录与复现实验持续整理中。

  1. 01

    Runtime contract 已完成

  2. 02

    受控真实 GIMP cohort 已记录

  3. 03

    Replay verification 与研究材料持续整理

已有证据

在冻结协议下的三个注册 GIMP 案例中,B0 不修复为 0/3,B1 朴素重试为 2/3,B2 DiagAgent 为 3/3。实验使用同一 resize 任务、固定 GIMP profile、确定性 oracle scaffold、fresh replay 和一次明确恢复尝试。

适用范围

这是小规模受控评估,不代表自主 LLM 规划、跨应用泛化或通用自愈能力。架构图表达职责分工,不代表已验证通用规划器。