DeepSeek Harness:可组合的 Agent 运行系统
沿插件树、服务与事件,理解哪些能力可以替换。
画出任务中的模型、工具与运行策略边界。
证据与边界
- 证据性质
- 固定源码观察
- 能支持
- 沿插件树、服务与事件,理解哪些能力可以替换。
- 不能证明
- 固定提交研究,不代表生产就绪或最新分支。
时效与访问
核验 2026-09-11;固定提交 c291e7961a51
可直接阅读官方网页;站内系统研究已给出中文解释。资料附录 · 用于核验与继续深入
与课程共用六个知识主题。每份资料归到一处,标明它支持的判断,并提供对应课程入口。
产品承诺查官方文档,研究结论查原始论文,实现机制查固定版本源码,实际表现查同任务运行记录。每类资料只能支持它直接记录的事实;社区转述可以帮助发现线索,不能单独证明核心机制。
按知识主题归档 · 每份资料只列一次
一项任务,怎样从愿望变成实际结果?
沿插件树、服务与事件,理解哪些能力可以替换。
画出任务中的模型、工具与运行策略边界。
核验 2026-09-11;固定提交 c291e7961a51
可直接阅读官方网页;站内系统研究已给出中文解释。Pi 的核心刻意保持精简,文档又完整公开 Session、Compaction、Security、Extensions、Skills 与 SDK,适合识别 Agent Harness 的必要责任。
画出模型接口、Agent 运行时、交互外壳和产品 Harness 四层图,并为循环、工具、状态、安全、扩展各写一个产品问题。
在线文档持续更新;实现结论固定核对至 v0.81.1(commit 20be4b18d4c57487f8993d2762bace129f0cf7c6)。
Pi 官方文档与 GitHub 在中国大陆的访问速度可能波动;本站结构剖面已包含完成课程所需的核心解释。它用最短篇幅说明本次公开了什么:Agent Loop、工具、终端 UI 与扩展系统。先读它可以建立范围边界,再进入源码,不会把开源仓库误当成完整服务端。
写一张“已公开 / 未公开 / 需要运行证据”的三列卡,再把已公开模块映射到本站 L1–L6。
2026-07-15 发布;源码结论仍以本站注明的固定 commit 为准。
xAI 官方页面与 GitHub 在中国大陆的访问速度可能波动;先读本站生产剖面,再按固定 commit 核对源码。这是少数能让产品经理同时核对 Session Loop、工具、权限、Sandbox、MCP、Skills、Hooks、Subagents 与 TUI 的生产级 Harness 证据库。正确用法是带问题定位模块,而不是按目录通读 Rust。
从 Agent Loop 或权限矩阵中选一题,提交“产品问题 → 用户可见状态 → 源码位置 → 仍缺什么运行证据”的四列证据卡。
固定在公开仓库 commit a5727c5960452e7527a154b25cb5bf00cda0545e;该快照的 SOURCE_REV 记录上游同步版本 30192d2eef5d91a8fff0e53957de5bd05b43398c。两者不是同一个版本标识,也不代表服务端或后续线上版本。
GitHub 在中国大陆可能加载较慢;建议优先使用本站中文拆解,再回源码定位。它用非研究者也能理解的方式建立 LLM 的能力边界,避免产品判断停留在功能印象。
一张 LLM 能力/限制表,至少覆盖幻觉、上下文、知识时效、计算成本与工具调用。
Token、训练与推理的基础原理长期有效;模型案例和产品名称会老化。
YouTube 在中国大陆通常无法直接访问;它不是完成站内课程的硬前置。这是把一次生成与 Agentic Workflow 区分开的高密度短讲,适合作为第一个系统心智模型。
为同一个 PM 工作流各写一版直接生成和 Agentic Workflow,并解释后者为何值得增加复杂度。
反思、工具、规划和多 Agent 协作四种模式仍是有效的入门框架。
YouTube 在中国大陆通常无法直接访问;它不是完成站内课程的硬前置。它不仅介绍常见 Agent 模式,还把评测、错误分析和生产优化纳入同一条学习链。
一份 Workflow Spec:任务拆解、工具、状态、停止条件、人工节点和组件级评测。
方法与错误分析框架高度有效;代码环境和库版本需以课程页面为准。
课程页面可能要求注册或登录;中国大陆网络可用性会变化。用很短的时间讲清一个 Agent 最小系统的组成,适合在进入源码前统一术语。
一张 Agent Anatomy 卡:目标、循环、工具、状态/记忆、边界和人工接管。
Agent loop、工具和状态概念长期有效;SDK 细节需对照最新文档。
OpenAI Academy 可能要求登录,且中国大陆网络可用性会变化。把 loop、context、tools、permissions、CLAUDE.md、subagents、skills、MCP 与 hooks 放在同一产品里观察。
一份 Claude Code 产品拆解:上下文入口、工具、记忆、权限、验证和失败恢复。
当前官方入门课程,客户端界面和具体功能仍会持续变化。
可能要求注册或登录;Anthropic 服务在中国大陆的可用性会变化。它提供少见的完整中文学习链。建议在本站理解最小工作闭环后,按 Unit 1 基础 → Unit 2 框架对照 → Bonus 2 评测 → Unit 4 项目的顺序实践,不必从 Unit 0 逐页刷完。
一个可运行 Agent、一次轨迹与结果评测,以及一页“框架替我做了什么、Harness 仍要负责什么”的复盘。
官方课程持续演进;框架 API 与认证安排应以课程页面为准。
Hugging Face 主站、登录、Spaces 与模型下载在中国大陆的速度和可用性可能波动;中文课件可直接阅读,交互练习不是完成本站课程的硬前置。它直接训练 Agent PM 最先要做的事:判断什么任务值得 Agent 化,并划定系统责任。
一份 Agent Requirements Doc:用户工作、触发器、输出、工具/数据、权限、停止条件、风险和评测。
场景发现与系统定界方法供应商无关,具体案例需结合当下模型能力。
OpenAI Academy 可能要求登录,且中国大陆网络可用性会变化。它把用户、工程、研究、社区和反馈闭环连接在同一个产品岗位里,是课程与面经的校准尺。
一张岗位原文信号 → 学习目标 → 可交付作品证据的目标拆解。
2026-07-23 核验;岗位状态和措辞可能随招聘变化,阅读时以官方招聘页现行内容为准。
岗位来自 DeepSeek 官方招聘站 talent.deepseek.com,详情页由其招聘系统承载;岗位状态和措辞可能变化,本站保留核验日期。它提供最清楚的一手定义:什么时候用 Workflow、什么时候用 Agent,以及为什么应从最简单方案开始。
把一个业务流程标注为 chaining、routing、parallelization、orchestrator-workers 或 evaluator-optimizer。
Workflow/Agent 区分和组合模式仍是行业基础;具体模型建议需查新文档。
Anthropic 页面在中国大陆的网络可用性可能变化。它从产品和工程共同语言出发,覆盖场景选择、编排和 Guardrail,适合把概念落到方案。
一份候选场景评分表,并明确先做单 Agent 还是多 Agent、为什么。
Model/Tools/Instructions、单/多 Agent 与 Guardrail 框架仍有效。
OpenAI 页面在中国大陆的网络可用性可能变化。它从 planning、tool、memory、failure 等系统问题解释 Agent,适合补足只会背四步循环的空洞理解。
一张 Agent 系统组件图,并为每个组件写出一个可观察失败信号。
核心系统分析仍有效;市场产品和框架样例会过期。
它用规划、记忆与工具三部分串起早期 Agent 研究,是进入经典论文前的高质量地图。
一张 planning × memory × tool use 文献地图,并标注哪些问题后来由 Harness 工程承担。
作为经典综述仍有教学价值;框架、论文进展和产品能力并非当前全貌。
它逐步展示一次 Turn 内模型推理与工具调用怎样循环,是理解 Coding Agent 内里的直接材料。
一条从用户输入到工具结果再到结束消息的事件序列,并标出上下文增长点。
Codex Harness 的 Agent Loop、上下文增长、缓存和压缩解释当前有效。
OpenAI 页面在中国大陆的网络可用性可能变化。它给出推理与环境行动交错进行的经典范式,帮助理解工具结果为什么必须回到下一轮判断。
把一个真实任务写成 Action/Observation 轨迹,并标出产品应展示的证据而非隐藏思维链。
Reasoning/Action/Observation 的核心思想仍是 Agent Loop 的历史基础;产品实现已更复杂。
它是把 Codex 工程文章里的 Agent Loop、App Server、工具与策略落到实现细节的第一手材料。
一张仓库模块地图,并为 Agent Loop、工具运行时、协议、权限各定位一个入口文件。
固定在 Codex CLI v0.145.0 commit 25af12f7e61572b0bc18ddb1008be543b91519b0;现行产品行为仍需回到动态文档核验。
GitHub 在中国大陆可能加载较慢;建议优先使用本站中文拆解,再回源码定位。它展示窄腰核心如何服务多个入口,并用 Skills、Plugins 与 MCP 控制扩展面和 Prompt Cache 成本。
一张 Hermes 与 Claude Code/Codex 对照表:核心循环、扩展点、上下文压缩、子代理和多端入口。
固定在 Hermes Agent v0.19.0(tag v2026.7.20)commit 3ef6bbd201263d354fd83ec55b3c306ded2eb72a;它代表该版本实现,不是行业统一标准。
GitHub 在中国大陆可能加载较慢;建议优先使用本站中文拆解,再回源码定位。它是理解 Hermes 当前产品面的主入口。推荐顺序是 Architecture → Tools → Memory → Skills → Security,再回到本站任务剖面对照产品责任;不要把安装教程当作架构教程从头刷。
一张“官方文档概念 → 固定提交模块 → 用户可见行为 → 风险/评测”的四列证据表。
官方现行文档;产品、模块和安装方式会继续变化,引用时记录核验日期。
Hermes 官方文档与 GitHub 在中国大陆的访问速度可能波动;先读本站固定提交拆解,再用在线文档核对现行产品。Claude、Agent、Context、Tool、Eval 与长任务 Harness 的重要一手文章集中在这里。
每月只选一篇,写“新事实、适用边界、对现有 PRD 的一个改动”,不做资讯搬运。
官方一手工程频道;新文章不自动等于必读,需按问题筛选。
Anthropic 页面在中国大陆的网络可用性可能变化。用于补足发布会、工程讲解和开发者课程中的现场语境。先查本站课程的待验证问题,再定向搜索 Agent、Claude Code、MCP、Context 或 Evals,不按上传时间刷频道。
一张三栏卡片:视频中的新事实、适用边界、它是否改变现有 PRD/评测;没有改变就不进入知识库。
官方视频频道;演示界面和模型能力会变,原理判断仍需回官方文档。
YouTube 在中国大陆通常无法直接访问;它不是完成站内课程的硬前置。它帮助学习者理解,Agent 改变工作分工但不会抹掉领域经验、任务选择、监督和验证。
一张“模型可承担 / 专业判断仍负责 / 必须验证”的三栏责任表。
研究结论绑定其样本、Claude Code 版本与任务;不把一次研究外推成普遍生产率定律。
Anthropic 页面在中国大陆的网络可用性可能变化。它把模型能力、工具、上下文、环境反馈和权限放回一个系统,适合解释 Harness 不是一层 Prompt。
重画一次任务的 Model / Harness / Client / Environment 责任图。
官方团队当前设计经验;产品细节会随模型和 Claude Code 更新。
Anthropic 页面在中国大陆的网络可用性可能变化。它用 Agent、Environment、Session、Brain/Hands、凭证代理和事件历史补齐 Demo 到生产之间的系统责任。
一张包含凭证、沙箱、持久 Session、恢复和审计的生产架构图。
产品能力与预览状态变化快;每次引用需核对现行文档。
Anthropic 页面在中国大陆的网络可用性可能变化。它此刻应该知道什么,之后又该记住什么?
它把 Context 从“塞更多 Prompt”升级为持续选择、维护和压缩运行时信息的系统职责。
一个 Context Budget:稳定指令、当前任务、检索材料、工具结果、工作记忆和压缩触发器。
最小高信号上下文、按需检索、压缩和隔离策略当前有效。
Anthropic 页面在中国大陆的网络可用性可能变化。它展示为什么长任务不等于更长上下文,以及 Harness 如何把跨会话连续性写进环境。
一份长任务接续协议:初始化、功能清单、进度、检查点、验证和下一位 Agent 的启动步骤。
增量推进、进度文件、Git 历史与端到端验证策略当前有效。
Anthropic 页面在中国大陆的网络可用性可能变化。它把 Memory 还原为有容量、写入、审批、安全扫描和下次会话生效语义的数据产品。
一张 Memory / USER / Session Search / Context 的数据边界表。
当前在线文档;字符上限、Provider 与审批默认值可能更新。
Hermes 官方文档与 GitHub 在中国大陆的访问速度可能波动;先读本站固定提交拆解,再用在线文档核对现行产品。它给出工具结果裁剪、结构化摘要、头尾保护和摘要模型窗口不足时静默丢上下文的具体案例。
为一次长任务写压缩前后必须保留、可丢弃和可回源的信息清单。
当前实现文档;阈值和算法可能随版本变化。
Hermes 官方文档与 GitHub 在中国大陆的访问速度可能波动;先读本站固定提交拆解,再用在线文档核对现行产品。它能做什么,谁能让它停下来?
沿一次工具调用核对策略、守卫、执行与记录的位置。
给自己的业务任务写一张行动授权矩阵。
核验 2026-09-11;固定提交 c291e7961a51
可直接阅读官方网页;站内系统研究已给出中文解释。它把 MCP 从“装插件”还原成能力发现、上下文交换和授权边界的系统设计问题。
一份 MCP 接入 PRD:架构、能力清单、授权范围、错误状态、日志字段和验收测试。
Host/Client/Server 架构长期有效;transport、auth 与 session 细节持续演进。
课程页面可能要求注册或登录;中国大陆网络可用性会变化。它用一个易记框架解释 Prompt Injection 何时从输出问题升级为真实数据与动作风险。
为自己的 Agent 标出私有数据、不可信输入和外部动作三类边,并设计至少两层隔离。
私有数据、不可信内容和外部通信组合的威胁模型仍高度相关。
它是自主性、分类器判断、误放行、误拦截和隔离环境之间权衡的最新产品案例。
对比 Default、Auto Mode 与跳过权限三种模式的风险、打断和适用环境。
发布时为 research preview;可用计划、模型和配置需以现行文档为准。
Anthropic 页面在中国大陆的网络可用性可能变化。它用真实操作串起 CLAUDE.md、权限、Skills、Hooks、Subagents、Plugins、MCP 和 Desktop,适合补用户体感。
选择一个真实任务,记录产品表面操作、底层责任层和一次失败分支。
讲师来自 Claude Code 团队;课程由 Frontend Masters 发布,产品界面会随版本变化。
课程页面可能要求注册或登录;中国大陆网络可用性会变化。任务变长、入口变多,怎样仍然保持一致?
分清模型选择、独立 Agent 委派与结果回传。
写出子任务的输入、产物、取消与核验合同。
核验 2026-09-11;固定提交 c291e7961a51
可直接阅读官方网页;站内系统研究已给出中文解释。系统比较 Skill、Prompt、Tool、MCP 和 Subagent,直接对应 Harness 的能力封装设计。
一个 Skill PRD 与 SKILL.md 骨架,包含触发、输入输出、资源、禁止事项和评测样例。
当前有效性高;不同产品面的分发和权限限制需持续核对。
课程页面可能要求注册或登录;中国大陆网络可用性会变化。它解释同一个 Harness 如何服务 CLI、IDE、桌面与 Web,并处理流式事件、审批暂停和重连。
一张 Client ↔ App Server ↔ Core Thread 架构图和 Thread/Turn/Item 状态表。
Thread、Turn、Item 和双向 JSON-RPC 的产品协议解释当前有效。
OpenAI 页面在中国大陆的网络可用性可能变化。这是核对 MCP 能力、生命周期与协议边界的第一手仓库,适合在课程或二手文章冲突时回源。
为一个 MCP 接入记录规范版本、能力协商、授权、错误、断线恢复与兼容性验收。
协议仓库持续演进;实现或 PRD 必须注明使用的规范版本。
GitHub 在中国大陆可能加载较慢;建议优先使用本站中文拆解,再回源码定位。用于观察 Codex、Agents 与开发者产品如何向用户解释价值和边界。推荐先读 changelog 定位变化,再看相关视频理解交互,不用视频标题替代技术事实。
一次“变更事实 → 用户任务 → Harness 影响 → 是否需要补评测”的更新记录。
官方视频频道;产品演示和发布日期易变,应与 Codex changelog、官方指南交叉核对。
YouTube 在中国大陆通常无法直接访问;它不是完成站内课程的硬前置。它帮助学习者区分稳定架构与会变化的客户端能力,避免用旧截图或旧教程描述当前 Codex。
维护一张“新增/变化 → 影响的用户任务 → 是否需要更新课程、评测或 PRD”的变更表。
官方现行变更记录;适合核对功能事实,不替代系统原理学习。
OpenAI 页面在中国大陆的网络可用性可能变化。它让学习者知道哪些是早期源码骨架、哪些是现行产品事实,避免把历史实现当最新版。
每月记录一项真正改变用户任务或 Harness 边界的变化,并说明是否影响现有竞品拆解。
官方现行变更记录;需与本站固定源码快照严格区分。
Anthropic 页面在中国大陆的网络可用性可能变化。它同时披露多 Agent 的收益、约 15 倍聊天 Token 成本、串行任务限制、恢复和评测难题。
为一个候选任务写出是否采用多 Agent 的分解性、成本、延迟和错误放大判断。
生产案例仍有价值;具体模型、Token 价格和系统限制会变化。
Anthropic 页面在中国大陆的网络可用性可能变化。它补足 MCP 教学最容易遗漏的 token passthrough、confused deputy、SSRF、scope、同意和本地 Server 信任。
一张 MCP Host / Client / Server / Authorization Server 的威胁与控制表。
安全指南随规范演进;课程固定记录核验日期和规范版本。
它清楚区分持久会话历史、活动上下文、恢复、跨端来源与 FTS5 检索。
一张 Session 存储、模型可见上下文和恢复流程图。
在线文档描述当前产品行为;源码结论另按固定 commit 核验。
Hermes 官方文档与 GitHub 在中国大陆的访问速度可能波动;先读本站固定提交拆解,再用在线文档核对现行产品。它展示 Skill 如何充当按需程序性记忆、怎样被 Agent 修改,以及为何需要 diff、暂存和人工批准。
一份 Agent 修改 Skill 的提案、Diff、审批、回滚和 Eval 流程。
当前在线文档;Agent-managed Skill 与 Hub 行为需持续核验。
Hermes 官方文档与 GitHub 在中国大陆的访问速度可能波动;先读本站固定提交拆解,再用在线文档核对现行产品。它用受控实验反驳“Agent 越多越好”,把任务可分解性、串行依赖、工具密度和验证结构变成决策变量。
为五个任务判断单 Agent、集中式、独立并行或混合架构,并说明证据。
当前为持续修订的研究;结果受 benchmark、模型和配置限制。
凭什么说它更好,凭什么决定上线?
它帮助学习者把能跑的 Demo 提升为有控制面和恢复路径的生产系统。
一张生产架构图和 failure mode × detection × recovery × owner × user message 矩阵。
降级、恢复、审批、审计和运营模式长期有效。
OpenAI Academy 可能要求登录,且中国大陆网络可用性会变化。它把 Agent 评测从一句“成功率”拆成组件、轨迹、Judge、实验和线上监控。
20 条最小评测集、router/tool/trajectory 三层指标,以及一次改动前后的实验报告。
Trace、组件评测和轨迹评测方法高度有效;工具 API 会变化。
课程页面可能要求注册或登录;中国大陆网络可用性会变化。它明确评测对象是模型与 Harness 的组合,并把结果评分与轨迹诊断分开。
为一个任务写出 Task、3 个 Trial、Outcome Grader、Transcript Grader 与失败归因字段。
Task、Trial、Grader、Transcript、Outcome 与 Harness 的区分当前有效。
Anthropic 页面在中国大陆的网络可用性可能变化。它把失败反馈、语言化经验和下一次尝试连接起来,适合解释为什么 Evaluator 需要可操作反馈。
为一个失败任务设计反思记录:证据、归因、可执行改动、复试条件和防止错误记忆的门槛。
反思与外部反馈思想仍有启发;具体实验结论需放在后续研究背景中理解。
它示范如何让任务、环境和外部测试共同定义 Outcome,而不是让 Agent 自己宣布完成。
一个 10 条真实任务的评测集草案,每条包含环境、约束、金标准和确定性验证器。
真实仓库任务与测试驱动评测的思想长期有效;排行榜与系统版本会持续变化。
它提供 AI 可能让经验开发者在熟悉仓库任务中变慢的反例,防止课程只收录成功故事。
写出样本、工具、任务、指标、结果、置信区间和五条不能外推的结论。
METR 已明确标注结果过时;只能作为特定时间与样本的历史实验。
它展示 Agent 普及会让“不使用 AI”对照组和任务提交产生选择偏差,测量方法也要随产品变化。
为 Agent 实验列出参与者选择、任务选择、并发 Agent 和时间记录四类污染及缓解方案。
当前方法更新;作者明确认为新数据只能弱支持提效幅度。
它提供与 METR 方向不同的大样本企业随机实验,帮助学习者理解工具、任务和指标改变会产生不同结果。
对照两类研究的样本、工具、自变量、结果指标和外部有效性。
正式研究结果仍有效;工具属于代码补全助手而非当前自主 Agent。
它指出只追准确率会掩盖成本、过拟合、留出集不足、下游适用性和不可复现。
审计一个 Agent leaderboard:任务、成本、holdout、复现、模型与 Harness 版本是否完整。
评测原则仍有效;具体 benchmark 生态持续变化。
它把任务质量、污染、评分可靠性、统计报告和复现要求组织成更严格的 benchmark 方法。
为结业作品的 20 个任务补齐版本、重复 Trial、Grader 校准、置信区间和复现说明。
研究方法可迁移;具体 Agent 和 benchmark 会继续更新。
怎样把这些知识组合成自己的产品方案?
理解业务界面、工具和数据由产品拥有,运行能力通过官方接口接入。
为一个现有业务页面标出产品责任和 Harness 责任。
核验 2026-09-11;官方页面
可直接阅读官方网页;站内系统研究已给出中文解释。它让学习者不只从 Claude Code 一个实现理解 Coding Agent,并能识别同类产品共同承担的系统责任。
一张 Claude Code vs Codex 对照表,以及一份任务、边界、验收、交付物齐全的委派契约。
当前 Codex 产品认知有效;具体客户端能力会继续演进。
OpenAI Academy 可能要求登录,且中国大陆网络可用性会变化。它说明 Agent-first 团队的人类工作如何转向表达意图、设计环境、维护知识和建立反馈回路。
一份 Agent-legible Environment 清单:知识、工具、日志、测试、约束、错误信息和维护责任。
环境可读性、仓库知识、机械约束和反馈回路的经验当前有效。
OpenAI 页面在中国大陆的网络可用性可能变化。它帮助学习者区分模型学会何时调用工具,与 Harness 提供工具、权限、执行和反馈的不同责任。
一张 Model 决策与 Harness 执行责任分界表,避免把 Tool Use 全部归因给模型。
作为工具学习研究的经典材料仍有价值;不等同于当代产品中的 Tool Calling API。
它适合追踪 Agent 教学与行业访谈,但只在本站课程暴露出具体问题时使用:先选一个问题,再找一条能回答它的视频,最后以作业或实验收口。
一个可复验结论:原假设、视频给出的证据、自己的最小实验、保留或推翻的判断。
官方教育频道;供应商和框架案例会老化,方法需用自己的项目复验。
YouTube 在中国大陆通常无法直接访问;它不是完成站内课程的硬前置。