Agent 失败时,怎样找到第一个错点?
教学假数据:任务要求分析 corpus-v2 的十份访谈,系统却沿用了上一次任务缓存的 corpus-v1。最终报告结构完整、引用也能打开,但其中两条结论来自旧版本。
不要从最终文案猜原因。沿任务记录往回看:用户选择的是 v2,任务契约保存的是 v2,但 Context Pack 装入了 v1。第一次偏离发生在材料装载,而不是模型写结论时。
失败分类只是为了回答两个问题:第一次在哪里偏离,应该由谁修。它不是一张需要背诵的术语表。
固定目标版本、实际读取版本和最终引用,沿记录找到第一次分叉。本例根因是 Context Pack 装入旧缓存,不是模型最后写错一句话。
先固定正确版本与实际版本
任务开始时记录目标版本 corpus-v2;每次读取材料时记录实际 corpus_hash;交付时把报告引用重新与 v2 对照。三处事实一摆在一起,版本错配就不再靠猜。
最终“引用能打开”只是症状检查。正确标准是“引用来自本次被授权并锁定的 corpus-v2”。
找到第一次偏离,再分配修复人
本例的首次偏离是 Context Pack 读取了旧缓存,Owner 是上下文与缓存模块;模型随后基于旧材料归纳,只是连锁结果。改 Prompt 或更换模型都没有触及根因。
其他失败也用同一方法:工具没有执行、权限错误放行、Verifier 漏检、客户端把失败显示成完成。类别的用途是把修复送到正确责任层。
修复后把这个样本留在回归集
修复包含三件事:任务启动时锁定 corpus_hash;恢复任务时再次比较版本;Verifier 发现引用不属于本次 corpus 时直接阻断交付。
把 corpus-v1/v2 错配保存成固定任务。以后每次改缓存、上下文或恢复逻辑都重跑;连续通过才说明这类失败被控制,而不只是被解释。
实现对照 · DeepSeek Harness
一句需求,怎样成为连续工作的系统?
“正在运行”“被阻断”“被取消”和“发生错误”是不同状态。源码会在轮次结束时记录原因,也支持在停止检查点接住尚未完成的工作。模型输出一段最终回答,不足以证明业务目标已经达到。
产品判断:设计继续和停止的条件,同时设计停止后用户还能拿到什么。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- 失败分类
- 用稳定类别描述失败发生在哪个任务阶段与责任层。
- 症状
- 用户最终看到的问题,不一定等于真正根因。
- 根因
- 最早导致后续错误、且能够通过具体修复控制的机制问题。
- 回归任务
- 未来版本必须重复运行、用来防止同类问题再次出现的固定样本。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Anthropic 的可信 Agent 指南强调从真实行动、失败与环境反馈建立可观察、可改进的质量证据。
官方事实ANTrustworthy agents in practice官方研究 · 核验 2026-07-14 - [2]
Anthropic 的可信 Agent 研究讨论现实部署中的错误、控制和风险。
官方事实ANTrustworthy agents in practice官方研究 · 核验 2026-07-14 - [3]
corpus-v1/v2 版本错配是本站教学假数据,用于演示首次偏离、责任归属与回归任务,不指向任何真实事故。
本站推演ANTrustworthy agents in practice官方研究 · 核验 2026-07-14 - [4]
本站的失败类别与 Owner 路由是产品诊断框架,不是 Anthropic 发布的固定分类法。
本站推演ANTrustworthy agents in practice官方研究 · 核验 2026-07-14
按需查阅的原始材料
- Configure permissions ↗Anthropic · 核验 2026-07-23
- Sandboxing ↗Anthropic · 核验 2026-07-23
- Automate actions with hooks ↗Anthropic · 核验 2026-07-23
- Hooks reference ↗Anthropic · 核验 2026-07-11
- Running Codex safely at OpenAI ↗OpenAI · 核验 2026-07-23
- Tracing - OpenAI Agents SDK ↗OpenAI Agents SDK · 核验 2026-07-11
- Grok Build session orchestration loop(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build permission manager(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent tool-call validation and recovery ↗Nous Research · 核验 2026-07-23
- Hermes Agent tool execution and guardrail handoff ↗Nous Research · 核验 2026-07-23
- Hermes Agent budget, completion and cleanup finalization ↗Nous Research · 核验 2026-07-23
- Hermes Agent durable session finalization ↗Nous Research · 核验 2026-07-23
- MCP Security Best Practices ↗Model Context Protocol · 核验 2026-07-14
- Hermes Agent Context Compression and Caching ↗Nous Research · 核验 2026-07-14