不同 Agent 产品,真正差在哪?
比较 Coding Agent 不能只比模型回答,而要用同一个任务检查它怎样规划、调用工具、请求权限、处理失败并交付可核对结果。
教学案例:仍然是“定位登录超时失败、修改代码并运行测试”。同一任务不变,才能看出不同 Agent 在读取范围、修改确认、失败恢复和结果验收上的真实差别。
先用 Pi 看最小骨架:模型怎样循环、工具怎样执行、状态怎样保存。再用 Grok Build 看生产系统怎样补上工作区、权限、界面和扩展。最后用 Claude Code、Codex、NousResearch/hermes-agent 对应的 Hermes Agent 比较用户真正经历的协作过程。
比较时始终带着同一组问题:它如何理解任务、采取行动、请求确认、处理失败并交付证据。官方说明、固定版本代码和实际运行记录分别回答不同问题。
用同一个任务与环境观察:启动成本、计划方式、读取范围、权限节奏、Diff 体验、测试验证、长任务恢复、记忆和扩展生态。功能存在只是门槛,完整任务体验才是产品。
先用 Pi 看见最小骨架
让 Pi 处理登录超时任务时,只追四件事:它把什么交给模型,怎样执行搜索和测试,工具结果怎样回到下一轮,什么时候结束。认出这四项责任以后,大型 Agent 就不再像一团黑箱。
Pi 的公开文档只能证明它承诺和公开了哪些机制,不能证明其他产品采用同一结构,也不能替代真实运行。
官方事实 · Pi Documentation · 见文末依据
再用 Grok Build 看生产系统怎样接线
最小循环能跑起来,还不等于可以交给真实用户。Grok Build 的固定源码帮助核对工作区、工具、权限、会话和终端界面怎样围绕同一任务协作。阅读时从产品问题反查相关模块,不从第一行开始通读。
固定源码只证明那个版本的公开实现。它不包含所有服务端能力,也不证明线上质量,更不是唯一正确架构。
固定源码观察 · xai-org/grok-build(固定提交) · 见文末依据
固定源码观察 · Hermes Agent repository architecture (fixed commit) · 见文末依据
最后比较成熟产品的用户体验
让 Claude Code、Codex 与 Hermes Agent 都从同一项目版本开始。记录它们先读什么、何时展示计划、改文件前怎样确认、测试失败后怎样继续,以及最终给用户什么证据。
“聪明、顺滑、稳定”太模糊。更有用的观察是:是否读错范围、用户要纠正几次、失败后能否继续、Diff 是否清楚、测试结果是否真的决定完成。
官方事实 · How Claude Code works · 见文末依据
官方事实 · Hermes Agent sessions · 见文末依据
结论必须分清事实、观察和解释
官方文档说明产品公开承诺;固定源码说明某个版本怎样实现;任务记录说明本次试跑真实发生了什么;解释则可能被新证据推翻。四类内容不能混在一句结论里。
比较时固定任务、项目版本、权限和完成标准,并保留失败与反例。结论只回答“哪种产品更适合哪类用户和任务”,不做脱离场景的总排行榜。
独立研究 · Establishing Best Practices for Building Rigorous Agentic Benchmarks · 见文末依据
实现对照 · DeepSeek Harness
一个 Agent 可以把任务交给另一套 Agent。
固定版本的 Codex 后端会为自包含任务创建新的临时线程,运行一个轮次,再返回最终答案或有限诊断。它并不会把子系统所有工具活动与原始过程复制回父会话。更换子任务后端因此会改变上下文、控制权和证据边界。
产品判断:先定义委派合同,再决定用多个 Agent。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- 产品分层地图
- 按 Model、Harness、Runtime、Client 与 User 责任记录一个 Agent 产品的公开事实和观察。
- 复合结果
- 多个系统层共同作用产生的最终任务表现,不能直接归因给单一模型。
- 核验日期
- 说明易变化的产品事实在哪一天由哪个官方来源确认。
- 观察
- 在固定任务中真实记录到的行为,不等同于对内部原因的证明。
- 推断
- 根据事实和观察提出、仍可被新证据推翻的原因解释。
- 证据边界
- 明确一条材料能支持哪种结论,以及哪些内部机制、长期可靠性或业务收益仍未被证明。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Pi 官方文档公开 Session、Compaction、Security、Extensions、Skills 与 SDK,适合核对精简 Harness 的责任范围;它不证明其他产品采用同一结构。
官方事实PIPi Documentation官方文档 · 核验 2026-07-16 - [2]
Grok Build 固定提交公开 CLI、TUI、Agent Runtime、工具、Workspace 与扩展模块;它不包含服务端,也不证明线上质量。
固定源码观察XAxai-org/grok-build(固定提交)官方源码 · 核验 2026-07-16 - [3]
Anthropic 官方文档用于支持 Claude Code 当前公开能力与使用方式;黑盒运行结果仍是模型、Harness、Runtime 与客户端的复合表现。
官方事实ANHow Claude Code works官方文档 · 核验 2026-07-14 - [4]
Nous Research 的固定提交源码用于核对 Hermes 的窄腰核心、扩展策略与当前实现;仓库自述不被当作独立行业结论。
固定源码观察NOHermes Agent repository architecture (fixed commit)官方源码 · 核验 2026-07-14 - [5]
Hermes 当前文档把有界 Memory、SQLite FTS5 Session Search 与完整会话历史分开;这支持机制区分,不支持“模型权重持续学习”的说法。
官方事实NOHermes Agent sessions官方源码 · 核验 2026-07-14 - [6]
公开 Agent 基准研究强调任务定义、评分、复现与外部有效性;因此本课要求每次比较固定任务与版本,进行多次 Trial,并主动记录反证和适用范围。
独立研究ZHEstablishing Best Practices for Building Rigorous Agentic Benchmarks论文 / 基准 · 核验 2026-07-14 - [7]
OpenAI Codex 官方文档用于支持 Codex 当前公开能力与使用方式;动态文档与固定源码快照需要分开记录。
官方事实OPCodex CLI documentation官方文档 · 核验 2026-07-14 - [8]
OpenAI App Server 文章公开了 Codex Thread、Turn、Item 与多客户端 Harness 接口案例。
官方事实OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14
按需查阅的原始材料
- DeepSeek Harness:可组合的 Agent 运行系统 ↗DeepSeek · 核验 2026-09-11
- Codex as a platform:把 Agent 放进业务产品 ↗OpenAI · 核验 2026-09-11
- Unrolling the Codex agent loop ↗OpenAI · 核验 2026-07-23
- Grok Build is Now Open Source ↗xAI · 核验 2026-07-16
- Grok Build repository map(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build session orchestration loop(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build permission manager(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build third-party provenance index(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build tool ports notice(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent repository and architecture guidance ↗Nous Research · 核验 2026-07-23
- Hermes Agent tool-call validation and recovery ↗Nous Research · 核验 2026-07-23
- Hermes Agent async delegation and turn finalization ↗Nous Research · 核验 2026-07-23
- Agentic coding and persistent returns to expertise ↗Anthropic · 核验 2026-07-23
- Hermes Agent Persistent Memory ↗Nous Research · 核验 2026-07-14
- Hermes Agent Skills System ↗Nous Research · 核验 2026-07-14
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity ↗METR · 核验 2026-07-14
- The Effects of Generative AI on High-Skilled Work ↗Microsoft Research · 核验 2026-07-14
- Use Claude Code Desktop ↗Claude by Anthropic · 核验 2026-07-23