Agent 产品真正应该看什么指标?
消息数、Token 和报告数只说明系统很忙。更接近价值的指标是:一份通过引用检查、无需大改并被用于评审的洞察草稿。
再配三类护栏:用户花了多少时间复核、一次任务花多少钱、是否出现越权或看似完成但实际错误。主指标变好而护栏失控,版本仍然不能放量。
以“可验证的有效任务完成”为核心,按场景组合成功率、完成深度、人工介入、时间节省、复用、成本、延迟和风险。没有单个指标能覆盖所有 Agent。
先定义什么叫一次有效完成
十份访谈任务只有同时满足引用检查通过、无需大幅重写、在约定时间内被用户采用,才算一次有效完成。分母是实际发起这类任务的合格用户或任务。
如果有效完成下降,再向下看材料覆盖、工具失败、人工接管、恢复、成本和时延。指标树的作用是找到可以行动的责任层。
简单任务和复杂任务分开看
如果新版多做了简单摘要,总成功率可能上升,但跨十份材料找反例的复杂任务反而退化。至少按任务难度、新老用户和版本分别看。
复杂高价值任务可以使用更强策略和更高预算,但必须证明额外成本换来了可验证质量,而不是更多文字。
速度只是证据链的一环
先看任务是否完成,再看用户是否采用、是否减少返工,最后才看团队决策周期是否改善。越接近业务结果,越需要更长观察,不能用生成速度代替。
公开研究既有变快也有变慢的结果,因为用户、工具和任务不同。它们提醒我们为自己的用户和任务验证,而不是替本产品给出结论。
独立研究 · Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity · 见文末依据
本课术语,放回情境理解
- 北极星指标
- 最能代表目标用户持续获得核心价值的主要产品指标。
- 护栏指标
- 防止主指标以牺牲成本、风险、质量或体验为代价增长的约束指标。
- P95
- 95% 样本不超过的时延或成本位置,用来观察尾部体验。
- 分层
- 把不同难度、用户和版本分开比较,避免总体数字掩盖局部退化。
- 静默错误
- 系统看似完成但结果错误,且没有向用户暴露失败信号。
- 指标链
- 把任务结果、用户采用、团队流程和业务结果逐层连接,并注明每层的证据强度。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Anthropic 的 Agent Eval 方法支持用真实任务、重复运行和结果证据衡量 Agent 质量。
官方事实ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [2]
DeepSeek 招聘信息强调 Agent 产品需在更多场景、更深入地帮助更多人,并连接模型与产品反馈。
官方事实DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14 - [3]
METR 在其早期 2025 年特定样本中观察到资深开源开发者使用当时 AI 工具慢 19%;该页面已标注结论时效,不能外推到所有 Agent。
独立研究MEMeasuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity论文 / 基准 · 核验 2026-07-14 - [4]
Microsoft Research 汇总三项现场随机实验后报告任务完成量提高 26.08%;研究对象是代码补全助手,不等同于自主 Agent。
独立研究MIThe Effects of Generative AI on High-Skilled Work官方研究 · 核验 2026-07-14 - [5]
本站的质量加权完成、指标树和 Go/No-Go 规则是产品指标教学推演。
本站推演ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14
按需查阅的原始材料
- Demystifying evals for AI agents ↗Anthropic · 核验 2026-07-23
- Running Codex safely at OpenAI ↗OpenAI · 核验 2026-07-23
- Tracing - OpenAI Agents SDK ↗OpenAI Agents SDK · 核验 2026-07-11
- Agentic coding and persistent returns to expertise ↗Anthropic · 核验 2026-07-23
- How we built our multi-agent research system ↗Anthropic · 核验 2026-07-23
- AI 产品经理(Agent Harness 产品方向) ↗DeepSeek · 核验 2026-07-23
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity ↗METR · 核验 2026-07-14
- We are Changing our Developer Productivity Experiment Design ↗METR · 核验 2026-07-14
- The Effects of Generative AI on High-Skilled Work ↗Microsoft Research · 核验 2026-07-14
- Towards a Science of Scaling Agent Systems ↗Google Research · 核验 2026-07-14
- AI Agents That Matter ↗Princeton NLP · 核验 2026-07-14
- Establishing Best Practices for Building Rigorous Agentic Benchmarks ↗NeurIPS · 核验 2026-07-14