它刚读过文件,下一步为什么又忘了?
教学案例:登录超时任务已经读过配置文件,但下一轮模型又问了一遍。原因通常不是它故意偷懒,而是模型每次只看见系统这次递交的一份有限材料。
把它想成一张工作台:任务、项目规则、工具说明、相关文件、刚才的测试结果都要摆上去。位置有限,Harness 必须决定哪些常驻、哪些按需读取、哪些只留摘要。
Token、上下文窗口、缓存等术语都服务同一个产品问题:怎样让当前判断拿到足够信息,又不把无关历史塞满工作台。
把上下文想成模型当前的工作台:登录超时任务、项目规则、相关文件、工具说明和最新测试结果都要争夺有限位置。Harness 决定谁进入、谁摘要、谁暂时留在外部。
模型这一轮究竟看见了什么?
模型不会一直看着整个项目。登录超时任务的目标、现行规则、相关文件片段和最新测试结果,必须在本次调用时重新装进有限的输入包。
- 目标
修复登录超时,测试通过且不改变公开 API。
- 规则
只读当前仓库;修改两个目标文件前先确认。
- 代码
auth/session.ts与相关测试片段。 - 最新结果
17/18 passed,一个 Mock 仍失败。
未放进来的文件不会被模型自动记住;大文件只保留位置,需要时重新读取。
例如重新读取测试 Mock,或请求修改文件。
下一轮必须重新选择要保留的目标、规则、文件与结果。
一次模型调用可以被产品经理读懂
一次调用可以简化成三包材料:必须遵守的规则、可以使用的工具、当前任务所需的事实。模型返回文字或一个工具请求,工具结果再进入下一轮。
登录超时任务中,当前错误、相关实现、测试文件和最近一次测试结果应该在场;无关目录和很早的搜索日志不必一直占位置。
把预算花在最值钱的决策上
先保证任务目标、项目边界和最新错误不会丢,再按当前步骤读取最相关文件。不要把整个仓库一次塞入,也不要平均截断所有材料。
系统还要为模型的下一步和最终交付留出空间。上下文策略同时影响遗漏、速度和成本,但用户首先感受到的是:Agent 有没有读对文件、有没有忘记关键限制。
压缩要保留可恢复任务所需的骨架
好的压缩保留目标、硬约束、已经排除的原因、关键文件位置、失败测试和下一步;原始文件仍留在项目里,需要时可以重新读取。
一旦摘要去掉了来源、否定条件或版本,后续模型可能沿着错误前提稳定执行。压缩策略必须进入测试,而不能被当成无害的后台优化。
Context Window、Cache 和 Memory 的边界
Context Window 是本次调用的工作台;KV Cache 是计算加速;Memory 是产品以后还会取回的信息。三者都可能让用户感觉“记得”,但解决的不是同一个问题。
界面不必显示每个 Token,却应该让用户看见关键文件、被保留的约束,以及信息不足时为什么暂停。
实现对照 · DeepSeek Harness
材料越来越多,怎样继续而不丢掉依据?
压缩过程记录开始、摘要或替换范围与结束。模型看到的是经过投影的有效上下文,日志继续保留相关事实。这样可以研究一次信息取舍怎样影响后续工作,而不是把历史无痕删短。
产品判断:同时检查上下文大小、证据召回、关键约束和最终结果。
固定源码观察 · 核验 2026-09-11。业务迁移为本站分析。
本课术语,放回情境理解
- LLM API
- 应用向大语言模型提交指令、工具说明和输入,并接收文字或结构化动作的接口。
- Token
- 模型处理文字的片段单位;字符数只能粗略估算 Token 数。
- Context Window
- 一次模型调用可处理的输入和输出总容量。
- Instructions
- 告诉模型角色、目标、规则和行为边界的高优先级输入。
- KV Cache
- 复用已计算序列状态的推理优化,减少重复计算,但不是产品层长期记忆。
- Compaction
- 在长任务中把旧上下文压缩成可继续工作的摘要、状态和回源指针。
- Memory
- 由产品选择、持久化并在未来任务中检索的信息。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
OpenAI 的 Codex Agent Loop 文章公开描述了 instructions、tools、input、工具结果回填与长任务压缩等 Codex 案例机制。
官方事实OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14 - [2]
工作台比喻与装箱顺序是本站教学示例,不是 OpenAI 推荐的固定比例。
本站推演OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14 - [3]
OpenAI 对 Codex Agent Loop 的公开拆解说明了上下文窗口有限、长任务需要压缩,并强调保留继续任务所需的关键信息。
官方事实OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14 - [4]
Hugging Face 官方说明 KV Cache 复用注意力层已经计算过的 Key/Value 状态以减少重复计算;它是推理优化,不是产品层长期记忆。
官方事实HUCaching · Transformers官方文档 · 核验 2026-07-14 - [5]
Anthropic 文档公开说明 Claude Code 的记忆/规则管理方式;这是 Claude Code 产品案例,不代表所有 Agent 的统一 Memory 实现。
官方事实ANManage Claude's memory官方文档 · 核验 2026-07-14
按需查阅的原始材料
- How Claude Code works ↗Anthropic · 核验 2026-07-23
- Effective context engineering for AI agents ↗Anthropic · 核验 2026-07-23
- How Claude remembers your project ↗Anthropic · 核验 2026-07-23
- Unrolling the Codex agent loop ↗OpenAI · 核验 2026-07-23
- Hermes Agent context compression and tool runtime ↗Nous Research · 核验 2026-07-23
- Hermes Agent Context Compression and Caching ↗Nous Research · 核验 2026-07-14