Agent 跑几小时,中断后怎样继续?
教学案例:登录超时修复扩展到大型仓库。Agent 已找到根因、写入补丁,相关测试正在运行时网络断开。重新连接后,它不能再次写补丁,也不能把未知的测试结果显示成成功。
长任务能力不是“能一直跑”,而是已有结果能保存、当前状态能解释、中断后能从可信位置继续。进度也不该只显示一个猜出来的百分比。
把任务拆成可验证阶段,持续外置状态和证据,保存检查点与未完成事项。恢复时重建必要上下文,而不是依赖模型“记得”。
六小时任务怎样暂停、恢复,又不重复副作用?
检查点不是一段聊天摘要。恢复前必须核对目标、资料版本、工具版本、外部回执和剩余预算。
- 排队中Queued · 等待资源
- 运行中Running · 产出阶段结果并持续保存检查点
- 验收中Verifying · 检查结果和副作用
- 已完成Completed · 证据通过
动作前暂停;批准后从原位置继续。
暂停可恢复;取消停止新动作并保存已有结果。
有限重试;超过预算转人工或部分交付。
明确已完成、未完成和下一步选择。
目标 · 材料版本 · 已完成阶段 · 证据位置 · 外部回执 · 待决事项 · 剩余预算
目标是否变化?资料是否换版?工具是否兼容?外部动作是否已发生?预算是否仍有效?
检查点保存的是继续工作的最小充分状态
检查点至少保存任务目标、项目版本、已完成阶段、补丁哈希、测试命令与回执、未决项和剩余预算。原始文件仍在仓库中,但必须能重新定位。
恢复时先核对环境是否变化,再从最后可信检查点继续。直接把旧摘要送回模型,可能在过期前提上稳定执行。
预算变化需要用户可选的降级方案
达到时间或费用阈值时,可以只跑相关测试、继续完整测试,或停止并交付补丁与已完成检查。选择必须说明会损失什么。
异步通知应包含产物、验证和待决策事项。只发送“任务完成”会把复核负担留给用户。
任务记录与执行环境要分开
任务记录保存目标、事件和证据;执行环境真正接触文件、命令和凭证。执行环境重启后,任务记录仍应存在,并能先核对项目版本再决定是否恢复。
生产系统还要处理身份、凭证、环境健康、事件持久化和审计。Anthropic 的 Managed Agents 是一个公开产品案例,不是行业唯一标准。
实现对照 · DeepSeek Harness
“以后自动做”,需要哪些真正的机制?
调度则向原有会话投递后续任务,支持延时、绝对时间和固定间隔。绝对时间有明确时区约定;错过重复周期时采用补偿规则,而不是把所有漏掉的周期无限补跑。
产品判断:把自动化拆为触发、材料、执行、异常、交付与停止六部分。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- 长任务
- 持续时间、步骤或外部依赖足以使中断与恢复成为核心产品需求的任务。
- 检查点
- 能够在中断后恢复工作的状态、证据和外部回执快照。
- 外置状态
- 保存在模型上下文之外、可持久读取的任务事实。
- 阶段产物
- 在整体结束前已经可独立检查和复用的中间交付。
- 恢复语义
- 系统如何确认旧状态、避免重复动作并从正确位置继续。
- Brain / Hands
- 把任务编排与上下文责任同隔离执行环境分开的生产架构视角。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
OpenAI App Server 的 Thread 和事件模型为长任务持久状态与客户端重连提供了公开产品案例。
官方事实OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14 - [2]
OpenAI 的 Harness Engineering 案例强调持久产物、环境反馈和可恢复的长周期工作。
官方事实OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14 - [3]
Anthropic 的 Managed Agents 文章把 Agent、Environment 与 Session 拆开,并描述凭证、隔离执行、持久事件和恢复等生产责任;这是其产品架构案例。
官方事实CLBuilding with Claude Managed Agents官方工程文章 · 核验 2026-07-14 - [4]
Anthropic 的长任务 Harness 工程文章说明长周期应用开发需要外置状态、阶段验证与可恢复工作;具体实现属于其案例。
官方事实ANHarness design for long-running application development官方工程文章 · 核验 2026-07-14 - [5]
本站检查点字段和四种预算选择是教学设计,不代表 Codex 固定实现。
本站推演OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14
按需查阅的原始材料
- DeepSeek Harness:子任务、提供方与生命周期 ↗DeepSeek · 核验 2026-09-11
- How Claude Code works ↗Anthropic · 核验 2026-07-23
- Effective context engineering for AI agents ↗Anthropic · 核验 2026-07-23
- Create custom subagents ↗Anthropic · 核验 2026-07-23
- Effective harnesses for long-running agents ↗Anthropic · 核验 2026-07-23
- Unlocking the Codex harness: how we built the App Server ↗OpenAI · 核验 2026-07-23
- Harness engineering: leveraging Codex in an agent-first world ↗OpenAI · 核验 2026-07-23
- Grok Build session orchestration loop(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent tool-call validation and recovery ↗Nous Research · 核验 2026-07-23
- Hermes Agent budget, completion and cleanup finalization ↗Nous Research · 核验 2026-07-23
- Hermes Agent durable session finalization ↗Nous Research · 核验 2026-07-23
- Hermes Agent context compression and tool runtime ↗Nous Research · 核验 2026-07-23
- Hermes Agent async delegation and turn finalization ↗Nous Research · 核验 2026-07-23
- The evolution of agentic surfaces: building with Claude Managed Agents ↗Claude by Anthropic · 核验 2026-07-23
- How we built our multi-agent research system ↗Anthropic · 核验 2026-07-23
- Auto mode for Claude Code ↗Claude by Anthropic · 核验 2026-07-23
- A harness for every task: dynamic workflows in Claude Code ↗Claude by Anthropic · 核验 2026-07-23
- Hermes Agent Sessions ↗Nous Research · 核验 2026-07-14
- Hermes Agent Context Compression and Caching ↗Nous Research · 核验 2026-07-14