哪些动作能自动做,哪些必须先问你?
权限决定 Agent 被允许做什么,审批决定何时必须等人,沙箱则限制动作即使出错也只能影响一个受控范围。
教学案例:在登录超时任务里,搜索和读取当前项目可以自动进行;修改两个目标文件要先展示范围;读取 .env、跨项目访问或执行危险命令应直接拒绝。
每一步都弹窗不会更安全,只会让用户习惯无脑确认。审批负责让用户做真正重要的决定,沙箱则在技术上限制文件、网络、进程和凭证;两者不能互相代替。
频繁无差别审批会形成确认疲劳。更好的系统根据资源范围、动作可逆性、外部影响和用户授权形成策略,在真正关键的节点提供具体、可理解的选择。
模型提出“改文件”以后,为什么不会直接执行?
权限课重点:权限策略(Policy)决定放行、询问或拒绝,沙箱(Sandbox)再限制实际可触达范围。
- 1提出意图
模型 → 运行系统edit_file(path, patch) - 2校验合同
参数类型、项目范围、幂等键
运行系统内部 - 3判断风险
放行自动继续;询问先等用户;拒绝直接阻断
权限策略 → 用户 - 4受限执行
在文件、网络、命令边界内调用工具
沙箱 → 工具 - 5回传事实
改动对比、退出码、结构化错误和外部回执
工具 → 运行系统 - 6记录与验证
写入事件记录,交给验收器(Verifier),并成为下一轮新观察(Observation)
运行系统 → 证据 / 模型
从 Capability Request 到执行
Agent 请求修改时要说明文件、原因、预计 Diff 和准备运行的测试。策略可自动允许项目内搜索与读取,修改明确文件时询问,访问密钥和项目外目录时拒绝。
审批卡要让用户能判断影响:改哪里、为什么、能否撤销、这次允许到什么范围。不要只放一个含糊的“继续”按钮。
拒绝也是正式产品状态
用户拒绝写入时,前面的搜索、原因假设和建议补丁仍然可以交付。Agent 应停在“等待确认”或“已拒绝”,不能换种说法反复索要同一权限。
恢复路径要在需求阶段设计:可改为只展示补丁、缩小文件范围,或由用户手动执行。拒绝不等于整个任务崩溃。
自动模式也必须保留硬边界
产品可以用规则或风险分类帮助低风险动作自动通过,但这种判断会出错。自动化越强,越需要沙箱、最小权限、凭证隔离、审计和立即停止。
Claude Code 的具体权限模式只是产品案例。课程关注的通用责任是:自动执行不等于取消边界,分类器也不是安全证明。
一次写入怎样被权限逐层限制
解析工具调用,先应用模式门禁,再经过权限策略和必要审批,最后在工作区/沙箱边界内执行并返回结构化结果。
产品经理要决定:模型只拥有提出动作的能力;真正的安全来自不可被提示词绕过的 Harness 与运行时边界。
查看 Grok Build 官方仓库中的对应实现提交 a5727c596045 · 核验 2026-07-23+
证据边界:审批是产品控制点,沙箱是技术执行边界;两者都不保证工具逻辑正确,也不能互相替代。
实现对照 · DeepSeek Harness
自动化越多,行动边界越要具体。
审批服务把结果区分为一次允许、拒绝、取消和应答不可用。只有一次允许能够授权该操作。无人应答和用户取消,不会被解释成默认同意。
产品判断:用具体动作、资源和结果写权限合同,同时规定无应答时怎样结束。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- 最小权限
- 默认只给完成当前任务所需的最小资源与动作范围。
- 沙箱
- 用技术边界隔离文件、网络、进程、设备或凭证访问。
- Capability Request
- Agent 对某项具体能力、资源范围和执行理由的结构化请求。
- 确认疲劳
- 频繁低信号弹窗使用户形成无脑批准习惯,反而降低安全性。
- 可逆性
- 动作造成的变化是否能低成本、完整地撤销。
- 风险分类器
- 在动作执行前估计其破坏性并允许、阻止或升级审批的模型或规则组件;它不是安全证明。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
OpenAI 公开描述了 Codex 在内部使用中的沙箱与安全运行实践;这是 Codex 案例而非唯一行业实现。
官方事实OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14 - [2]
Anthropic 的可信 Agent 研究强调自主性必须配合监控、控制和现实部署中的安全边界。
官方事实ANTrustworthy agents in practice官方研究 · 核验 2026-07-14 - [3]
Anthropic 将 Auto Mode 描述为相对跳过权限风险更低的中间路径,同时明确分类器会误放行或误阻止,仍建议隔离环境。
官方事实CLAuto mode for Claude Code官方工程文章 · 核验 2026-07-14 - [4]
本站五维风险评分和三档授权是教学框架;具体权限模式与边界应以产品现行文档为准。
本站推演ANChoose a permission mode官方文档 · 核验 2026-07-14
按需查阅的原始材料
- DeepSeek Harness:工具执行与审批 ↗DeepSeek · 核验 2026-09-11
- Configure permissions ↗Anthropic · 核验 2026-07-23
- Sandboxing ↗Anthropic · 核验 2026-07-23
- Automate actions with hooks ↗Anthropic · 核验 2026-07-23
- Hooks reference ↗Anthropic · 核验 2026-07-11
- Running Codex safely at OpenAI ↗OpenAI · 核验 2026-07-23
- Grok Build repository map(固定提交) ↗xAI · 核验 2026-07-23
- Grok Build permission manager(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent tool execution and guardrail handoff ↗Nous Research · 核验 2026-07-23
- Auto mode for Claude Code ↗Claude by Anthropic · 核验 2026-07-23
- Model Context Protocol Authorization ↗Model Context Protocol · 核验 2026-07-14
- MCP Security Best Practices ↗Model Context Protocol · 核验 2026-07-14
- InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM Agents ↗ACL Anthology · 核验 2026-07-14
- Use Claude Code Desktop ↗Claude by Anthropic · 核验 2026-07-23