用户说喜欢,为什么还不能上线?
用户说喜欢计划面板,不等于它真的减少返工。先用访谈理解原因,再用离线 Eval 排除质量和安全退化,最后只对一小部分真实任务开放。
实验期间固定模型、Harness、工具和材料版本。否则结果变好或变坏时,不知道是哪一项变化造成的。
表达偏好不等于行为收益。先通过访谈理解原因,再用任务评测排除能力退化,最后通过灰度观察完成率、打断率、耗时和留存。
用户说喜欢以后,产品还要过哪几关?
十份访谈先帮助理解原因;离线 Eval 检查能力和风险;内部试用暴露真实工具问题;小流量灰度验证行为。任一护栏失败,都应停下或回滚。
- 1访谈理解问题与机制
用户为什么需要计划面板?它在哪一步减少不确定?
形成假设 - 2离线评测(Eval)固定任务重复运行
结果、引用、权限和失败处理没有退化。
能力关卡(Gate) - 3内部试用观察真实协作
记录等待、改计划、人工接管和工具故障。
可用性关卡(Gate) - 4小流量灰度验证真实行为变化
完成率、耗时与护栏按预先规则判断。
产品关卡(Gate) - 5发布或回滚只按预注册条件收口
越权、静默错误或关键任务退化立即停止。
人工决定
先访谈,再离线检查,最后小流量
访谈发现用户在哪一步失去理解和控制;离线 Eval 检查引用、权限和失败路径;团队内部先用;通过后再给小部分用户灰度。
每一步都有停止条件。出现越权、引用退化或静默错误时立即回滚,不因为满意度提高继续放量。
运行前先写下判断标准
开始前写明对谁开放、改变什么、看哪个主指标、哪些护栏不能变差、什么情况停止。十份访谈任务应按完整任务分组,不让同一次任务跨两种体验。
失败记录只保留改进所需的最少字段。原文或敏感轨迹进入分析前需要用户同意、脱敏、访问控制和删除期限。
提前写下什么会推翻原假设
例如计划面板提高完成率,却显著增加等待;或只帮助熟练用户、伤害新用户,都不能宣布整体成功。分层差异和副作用要与平均结果一起报告。
如果样本不足或选择偏差太大,就把结论降为“尚未确认”,缩小范围或继续收集证据。不要换一个更好看的指标。
独立研究 · Updated analysis of AI coding productivity uplift · 见文末依据
产品实验 · 从系统研究到实践
把这些机制变成自己的产品实验。
第一轮只改证据读取工具,第二轮再比较上下文策略,第三轮才考虑子任务拆分。每轮使用同一组样本,记录未完成、错误引用、越界动作与成本,保留能解释差异的轨迹。
产品判断:把“我觉得更聪明了”改写为可复核的改进结论。
本站设计的教学实验,不是 DeepSeek 官方基准或实测成绩。
本课术语,放回情境理解
- Dogfood
- 团队在真实内部工作中先使用产品,发现实验室任务遗漏的问题。
- 灰度
- 把新版本逐步开放给受控流量,并保留停止和回滚能力。
- 版本固定
- 实验期间保持模型、Harness、工具和材料版本不变,避免原因混在一起。
- 反证条件
- 在实验前写明哪些结果、分层差异或副作用会推翻或削弱原假设。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Anthropic 的 Agent Eval 方法强调先用可重复任务与多次 Trial 建立能力和回归证据。
官方事实ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [2]
DeepSeek 招聘信息体现真实用户反馈、工程与研究之间需要持续闭环。
官方事实DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14 - [3]
METR 2026 更新公开说明其后续研究受选择偏差影响,不能可靠估计总体生产率;这是主动降低结论强度的反证案例。
独立研究MEUpdated analysis of AI coding productivity uplift论文 / 基准 · 核验 2026-07-14 - [4]
Microsoft Research 的现场实验说明真实行为研究可以补充离线任务,但其代码补全场景不能直接外推到自主 Agent。
独立研究MIThe Effects of Generative AI on High-Skilled Work官方研究 · 核验 2026-07-14 - [5]
本站从访谈到灰度的五阶段 Gate、随机单元、反证条件和隐私闭环是实验教学框架。
本站推演ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14
按需查阅的原始材料
- Demystifying evals for AI agents ↗Anthropic · 核验 2026-07-23
- Tracing - OpenAI Agents SDK ↗OpenAI Agents SDK · 核验 2026-07-11
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity ↗METR · 核验 2026-07-14
- We are Changing our Developer Productivity Experiment Design ↗METR · 核验 2026-07-14
- The Effects of Generative AI on High-Skilled Work ↗Microsoft Research · 核验 2026-07-14
- Towards a Science of Scaling Agent Systems ↗Google Research · 核验 2026-07-14
- AI Agents That Matter ↗Princeton NLP · 核验 2026-07-14
- Establishing Best Practices for Building Rigorous Agentic Benchmarks ↗NeurIPS · 核验 2026-07-14