模型怎样读文件、跑命令和改系统?
工具调用是模型向运行系统提出的一次结构化行动请求;真正执行动作、返回结果并承担副作用的是 Harness,而不是模型文字本身。
教学案例:模型说“搜索 timeout”并不会自动看到文件。Harness 要把请求交给搜索工具,拿回真实路径,再把结果交给下一轮判断。
一个工具就是一份行动合同:它叫什么、接收哪些参数、能碰哪些资源、成功会返回什么、失败后能否重试。登录超时任务先只需要搜索、读文件、改补丁和跑测试四类窄工具。
工具是一份带名称、说明和参数约束的能力合同。模型负责选择与填参,Harness 负责校验、授权、执行、超时、重试和返回结构化结果。
模型提出“改文件”以后,为什么不会直接执行?
工具课重点:把模型意图变成窄参数合同,并让成功与失败都返回结构化结果。
- 1提出意图
模型 → 运行系统edit_file(path, patch) - 2校验合同
参数类型、项目范围、幂等键
运行系统内部 - 3判断风险
放行自动继续;询问先等用户;拒绝直接阻断
权限策略 → 用户 - 4受限执行
在文件、网络、命令边界内调用工具
沙箱 → 工具 - 5回传事实
改动对比、退出码、结构化错误和外部回执
工具 → 运行系统 - 6记录与验证
写入事件记录,交给验收器(Verifier),并成为下一轮新观察(Observation)
运行系统 → 证据 / 模型
工具描述同时服务模型和策略
名称和描述帮助模型从相邻能力中选对工具,Schema 限制参数结构;权限等级和副作用说明帮助策略决定允许、审批或拒绝。万能工具看似简单,通常会让选择、授权和审计都变得模糊。
拆分不应追求越细越好,而应围绕动作含义和风险边界。搜索与读取不改环境,应用补丁会改文件,运行测试会启动进程,因此应是不同能力。
错误必须告诉 Agent 下一步能做什么
暂态错误可能有限重试,永久错误需要换路径,权限错误要请求授权,输入错误要修正参数,业务冲突要交给用户判断。统一返回“未知错误”只会诱发盲目重试。
有副作用的工具超时后不能盲目重复。最终成功回执要能查证:改了哪些文件、命令退出码是多少、哪些测试通过;一段漂亮的自然语言顶不了账。
登录超时任务需要哪四件工具
search_files 只返回项目内路径;read_file 只读取已授权文件;apply_patch 只能修改审批卡列出的文件;run_tests 返回命令、退出码和测试摘要。四个工具都要有明确错误,而不是统一说“失败”。
第一版不提供提交代码、推送分支或发布能力。用户拿到的是可复查 Diff 和测试证据,是否合并仍由人决定。
实现对照 · DeepSeek Harness
自动化越多,行动边界越要具体。
审批服务把结果区分为一次允许、拒绝、取消和应答不可用。只有一次允许能够授权该操作。无人应答和用户取消,不会被解释成默认同意。
产品判断:用具体动作、资源和结果写权限合同,同时规定无应答时怎样结束。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- Tool Contract
- 工具名称、描述、参数、权限、执行语义、回执、错误与审计的完整约定。
- Schema
- 对结构化参数字段、类型、必填项和允许值的约束。
- 幂等
- 同一请求重复执行不会产生重复业务结果。
- 回执
- 外部系统对动作是否发生、作用对象和当前状态的可查询证明。
- 暂态错误
- 网络抖动等可能在条件变化后恢复的错误;与稳定的权限或业务错误不同。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Anthropic 的 Agent 工程文章强调工具定义、接口设计与环境反馈对 Agent 表现的重要性。
官方事实ANBuilding effective agents官方工程文章 · 核验 2026-07-14 - [2]
MCP 官方架构将 Tools 作为 Server 可向 Host 暴露的能力类型之一。
官方事实MOMCP architecture overview官方文档 · 核验 2026-07-14 - [3]
本站的五类错误、幂等和工具拆分规则是面向生产产品的综合设计框架。
本站推演ANBuilding effective agents官方工程文章 · 核验 2026-07-14 - [4]
登录超时任务的四件工具与边界为本站教学设计,并非 MCP 规范规定的内容。
本站推演MOMCP architecture overview官方文档 · 核验 2026-07-14
按需查阅的原始材料
- DeepSeek Harness:工具执行与审批 ↗DeepSeek · 核验 2026-09-11
- Writing effective tools for AI agents - with AI agents ↗Anthropic · 核验 2026-07-23
- Connect Claude Code to tools via MCP ↗Anthropic · 核验 2026-07-23
- A practical guide to building agents ↗OpenAI · 核验 2026-07-23
- Grok Build third-party provenance index(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build tool ports notice(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent repository and architecture guidance ↗Nous Research · 核验 2026-07-23
- Hermes Agent tool execution and guardrail handoff ↗Nous Research · 核验 2026-07-23
- Hermes Agent context compression and tool runtime ↗Nous Research · 核验 2026-07-23
- Harnessing Claude’s intelligence ↗Claude by Anthropic · 核验 2026-07-23