Agent 比聊天模型多了什么?
Agent Harness 是包在模型外面的一整套运行系统:它准备上下文、开放工具、限制权限、保存状态,并检查任务是否真的完成。
本课的文件名、日志和测试数字全部是教学假数据。任务很具体:登录超时测试偶发失败,请找到原因、修复代码,并运行相关测试证明修好了。
如果只把任务发给聊天模型,它最多给出排查建议。它看不到当前项目,也不能搜索代码、修改文件或运行测试。Agent 多出来的是一套围绕模型的运行系统:把项目交给模型,提供工具,保存每一步结果,检查权限,最后用真实证据交付。
这套运行系统通常叫 Harness。Diff 指修改前后文件内容的对比。先记住这两个词就够了:模型提出下一步,Harness 让工具受控执行;用户通过 Diff 和测试结果检查到底发生了什么。
模型只能根据眼前材料提出下一步。让它真的读取文件、修改代码、等待批准、运行测试并交付 Diff 的,是模型之外的一整套运行系统。Harness 是这套系统的常用称呼,不需要先背定义。
一句任务,怎样穿过运行系统变成真实结果?
左边是用户看到的过程,右边是同一步背后的系统责任。责任可以合并实现,但不能消失。
“修复登录超时,并运行测试证明修好了。”
- 01正在调查读取项目规则,搜索 timeout
- 02等待确认准备修改 2 个文件
- 03正在验证运行 18 项相关测试
- 04交付结果改动对比(Diff)+ 18/18 测试通过 + 未决风险
只把任务、规则、相关文件和最新工具结果送给模型。
根据当前证据提出下一步:继续读、调用工具或给出结果。
保存进度,把工具结果送回下一轮,并支持暂停与恢复。
决定放行、询问或拒绝,并限制文件、网络和命令边界。
真正读取、搜索、编辑代码并运行测试。
从改动对比、退出码和测试结果判断是否真的完成。
先跟完一次任务
用户输入“登录超时测试失败,请找到原因、修复并运行测试”。系统先读取项目说明和最近错误;模型请求搜索 timeout;搜索工具返回两个相关文件;模型读到时间单位写错,提出最小修改;系统在写入前暂停,请用户确认文件范围。
用户允许后,编辑工具修改代码,终端工具运行相关测试。测试 18/18 通过,系统把根因、Diff、测试结果和未决风险放进交付。用户最终拿到的不是一句回答,而是一组能被检查的环境变化和证据。
再把刚才发生的事拆成四个部分
界面接收任务并展示进度与确认;Harness 准备模型当前看见的文件和规则,并管理权限与状态;模型提出下一步,工具真正读取、修改和测试;最后由验证结果决定继续还是完成。
工程实现可以把几个责任写进同一模块,也可以拆成多个服务,但责任不能凭空消失。后面的 Pi 会展示最小版本,Grok Build 会展示生产系统怎样补上会话、工作区、隔离、扩展和恢复。
为什么更强的模型也不能替代整套系统
模型可能判断错,但系统也可能给错文件、把失败的命令显示成成功、默认开放过大权限,或者没有运行测试就宣布完成。换模型只会解决其中一部分问题。
产品经理定位失败时,要沿任务记录找到第一个偏离:模型当时看到了什么、提出了什么、工具实际做了什么、系统记录了什么。能找到第一次出错的位置,问题才有明确负责人和回归办法。
实现对照 · DeepSeek Harness
一套 Agent,可以怎样被重新组合?
DeepSeek Harness 把这些能力放在可组合的插件树里,连默认 Agent Loop 都由插件提供。Profile 表达一种组装,Bundle 提供一组部件,后续配置可以替换或补充。Cordis 通过服务依赖启动插件,并在卸载时撤销相关注册。
产品判断:先定位任务卡在哪一层,再决定改模型、资料、工具还是运行策略。不要因为可替换,就一次换掉所有部件。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- Model
- 根据当前输入预测文字或结构化动作的模型;它只看到被送入本次调用的信息。
- Harness
- 连接模型和环境的运行系统,管理上下文、工具、状态、策略、循环和交付。
- Client
- 用户实际协作的 CLI、IDE、桌面、Web 或移动端界面。
- Tool
- 由 Harness 调用、能够读取或改变真实环境的窄能力合同。
- Environment
- 文件、代码仓库、数据库、业务系统、网页等任务发生的真实世界。
- Diff
- 文件修改前后的内容对比,用来检查改了哪里、是否超出批准范围。
- Turn
- 一次用户驱动的工作单元,内部可以包含多次模型调用、工具执行和审批。
- Observation
- 工具执行后返回给模型的新事实,例如文件内容、错误、退出码或业务回执。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
OpenAI 对 Codex Agent Loop 的公开拆解说明模型输入由 instructions、tools 与 input 组成,工具结果会回到后续循环。
官方事实OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14 - [2]
OpenAI App Server 将 Thread、Turn、Item、审批和事件作为 Codex Harness 的公开产品接口。
官方事实OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14 - [3]
Anthropic 强调工具设计、环境反馈与简单可组合模式对有效 Agent 的重要性。
官方事实ANBuilding effective agents官方工程文章 · 核验 2026-07-14
按需查阅的原始材料
- DeepSeek Harness:可组合的 Agent 运行系统 ↗DeepSeek · 核验 2026-09-11
- Building effective agents ↗Anthropic · 核验 2026-07-23
- How Claude Code works ↗Anthropic · 核验 2026-07-23
- A practical guide to building agents ↗OpenAI · 核验 2026-07-23
- Unrolling the Codex agent loop ↗OpenAI · 核验 2026-07-23
- Grok Build is Now Open Source ↗xAI · 核验 2026-07-16
- Grok Build repository map(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent repository and architecture guidance ↗Nous Research · 核验 2026-07-23
- Harnessing Claude’s intelligence ↗Claude by Anthropic · 核验 2026-07-23
- The evolution of agentic surfaces: building with Claude Managed Agents ↗Claude by Anthropic · 核验 2026-07-23
- AI 产品经理(Agent Harness 产品方向) ↗DeepSeek · 核验 2026-07-23