01 / Research
Agent Reliability
Agent 如何理解失败,并从失败中恢复?
- Trace
- Evidence
- Verification
- Recovery
- DiagAgent
证据驱动的 GUI Agent 恢复
- GIMP-DiagBench
DiagAgent 的研究起点
Personal AI Lab / Research Builder
AI Agent 工程实践者 & Research Builder
构建可靠、可验证、可扩展的智能系统。
探索如何让 AI Agent 理解环境、执行任务,并通过证据验证结果。
正在构建
研究方向
Agent Reliability Framework
Planning · Memory · Context
理解问题与上下文02 / 从问题到系统
三个研究方向,一个持续演进的系统:理解失败、执行任务、积累知识。
01 / Research
Agent 如何理解失败,并从失败中恢复?
证据驱动的 GUI Agent 恢复
DiagAgent 的研究起点
02 / Engineering
Agent 如何完成真实环境中的任务?
测试驱动的 Coding Agent Runtime
工具执行与观察反馈
隔离执行环境 · 工程能力方向
03 / 知识
智能体如何持续积累知识?
知识 → 实验 → 系统
03 / Agent 方法论
智能系统不仅需要产生答案,还需要理解环境、执行任务,并证明自己的结果。
理解任务、环境与约束。
Task Understanding · Planning · Context通过工具和运行时执行动作。
Tool Execution · Environment Interaction记录状态、反馈和执行证据。
State · Trace · Feedback独立检查过程、产物和任务结果。
Evidence · Validation · Evaluation在证据支持的范围内修复或停止。
Diagnosis · Repair · Adaptation04 / Reliability / Execution / Memory
三个系统,连接问题、方法与验证。
01 / Agent Reliability · 精选研究
执行轨迹 / 证据链
示意轨迹占位:说明证据链结构,不代表真实实验记录或评测结果。
GIMP-DiagBench 属于该研究的基准与评估脉络。研究资料与证据见项目详情。
02 / Agent Execution
03 / 智能体记忆 · 本站知识系统
05 / 持续演进的实验室
持续构建不是一张完成清单,而是一条可以回看的研究路径。
构建轻量级 Coding Agent 运行框架。
Agent Loop · Tool Registry · Test Verification探索可靠 GUI Agent 的诊断与恢复。
Evidence Graph · Guarded Recovery · Replay Verification持续建设个人 AI 与知识基础设施。
Markdown · Retrieval · Source-visible AI06 / 持续学习与知识积累
从外部线索到自己的知识,再从知识走向实验、写作与系统。
收集外部线索,保留原始来源。
阅读、判断,整理为自己的知识。
检索相关材料,依据来源辅助思考。
把理解带回写作、实验和工程。
搜索与问答使用现有全文检索与来源引用;语义 RAG 待建设。此图展示知识工作流,不代表实时采集状态。
浏览公开知识体系07 / 记录思考,分享实践
记录构建 AI 系统过程中的想法、实验与经验。
Research
RepoMedic 与 DiagAgent 在不同边界上验证执行结果,但都把执行证据视为结果的一部分。
RepoMedic 与 DiagAgent 在不同边界上验证执行结果,但都把证据视为结果的一部分。
Reflection
让写作独立于展示工具,使用 Markdown 保存作者自己的长期知识。
让写作独立于展示工具,使用 Markdown 保存作者自己的长期知识。
08 / 研究、工程与长期积累