同一个任务做十次,怎样才算可靠?
Agent 评测不是给一段回答打分,而是让同一任务重复运行,再同时检查真实结果、行动轨迹、成本、风险与体验。
先记住五个词:Task 是题目;Trial 是独立做一次;Trace 是这次做过什么;Outcome 是真实结果;Grader 是按标准检查结果的人或程序。
例如同一个“十份访谈生成可回源洞察”任务独立跑三次。每次都从相同材料和权限开始,保存过程,最后检查引用、反例、原文保护和草稿文件。这样才能看出稳定性。
复杂统计、排行榜和模型评分器校准放在可选深挖。主线先学会用少量真实任务、清楚标准和重复运行做一次可信版本判断。
Task 是题目,Trial 是独立做一次,Trace 是做过什么,Outcome 是真实结果,Grader 是按标准检查。对同一个十份访谈任务跑三次,才能区分偶尔成功和稳定完成。
为什么一次成功不能证明 Agent 可靠?
一次独立试跑(Trial)同时产生可观察轨迹(Trace)和真实结果(Outcome);把同一任务(Task)从干净环境重复运行,才能看见稳定性、失败类型、成本与风险。
目标、资料版本、权限、工具、完成证据
工具、审批、错误、成本、首次偏离点
文件、测试、引用、业务状态与副作用
能力报告(Capability)/ 回归发布门槛(Regression)
先把五个词放进同一条运行记录
Task 写清十份材料、授权范围和完成标准;Trial 从干净环境独立运行一次;Trace 保存读取、引用、审批和失败;Outcome 是实际草稿和文件状态;Grader 对照规则判定。
五个词分别回答:测什么、跑哪一次、发生了什么、现实中留下什么、按什么判对错。不要把它们压成一个“准确率”。
先用五道最重要的题
题 1 检查每条洞察能否回到真实引用;题 2 检查来源冲突时是否保留冲突;题 3 检查未授权原文是否始终未读;题 4 检查工具失败后是否诚实降级;题 5 检查材料不足时是否停止编造。
每题固定 corpus 版本、权限和通过标准。先把五题跑通,再扩到本课提供的十题标准案例。
能机器检查的,不交给感觉
引用是否存在、10/10 是否处理、原文是否越权、草稿是否保存,都由代码或真实状态检查。洞察是否有价值、反例是否充分,再交给清楚 Rubric 和人工抽样。
Grader 不要求模型走唯一固定路径。只要结果达标、过程没有越权,新路径可以被接受。
版本判断看三次运行和失败分布
同一题至少跑三次,保留全部成功和失败。权限越界、错误引用和“证据不足仍下结论”属于阻断项,只要出现一次就不能发布。
报告写清模型、Harness、工具和 corpus 版本。可选深挖再学习 Capability、Regression、pass@k、评分器校准和公开基准边界;这些概念不能替代最小 Eval。
产品实验 · 从系统研究到实践
把这些机制变成自己的产品实验。
第一轮只改证据读取工具,第二轮再比较上下文策略,第三轮才考虑子任务拆分。每轮使用同一组样本,记录未完成、错误引用、越界动作与成本,保留能解释差异的轨迹。
产品判断:把“我觉得更聪明了”改写为可复核的改进结论。
本站设计的教学实验,不是 DeepSeek 官方基准或实测成绩。
本课术语,放回情境理解
- Task
- 包含目标、环境、工具、完成证据和约束的一道 Agent 评测任务。
- Trial
- 同一 Task 的一次独立运行。
- Trace
- Trial 中可观察的模型输出、工具、状态、审批与结果记录;官方资料也可能使用 Transcript 或 Trajectory。
- Outcome
- 运行结束后环境中的真实结果,而不是 Agent 自己说完成。
- Grader
- 用代码、状态、模型或人工对 Outcome 与关键轨迹进行评分的检查器。
- Eval Harness
- 负责重置环境、运行多次 Trial、记录版本并汇总评分的评测系统。
本课依据与证据边界
正文引用对应下面的具体结论。厂商资料、固定版本实现与本站解释分别标识。
- [1]
Anthropic 的 Agent Eval 方法强调从代表真实使用的任务开始,并为任务准备可验证结果、参考证据与正反样本。
官方事实ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [2]
Anthropic 的 Agent Eval 文章区分 Task、Trial、Transcript 与 Outcome;本站将可观察过程统一称为 Trace,并通过重复运行观察非确定性。
官方事实ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [3]
Anthropic 建议按结果类型组合代码、模型与人工 Grader,并用人工样本校准模型评分器。
官方事实ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [4]
本站用三次运行和阻断项组织最小发布判断,是将公开评测方法翻译成产品教学的做法。
本站推演ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14 - [5]
公开的 Agent 基准最佳实践强调任务有效性、评分器漏洞、复现性、版本与外部有效性;这些进阶问题在本课可选深挖中保留。
独立研究ZHEstablishing Best Practices for Building Rigorous Agentic Benchmarks论文 / 基准 · 核验 2026-07-14 - [6]
AI Agents That Matter 提醒评测同时报告成本、可复现性并警惕基准过拟合;其结论同样受研究样本与时间限制。
独立研究KAAI Agents That Matter论文 / 基准 · 核验 2026-07-14 - [7]
SWE-bench 是使用真实 GitHub Issue 与代码仓库评测软件工程能力的公开基准案例。
独立研究PRSWE-bench: Can Language Models Resolve GitHub Issues?论文 / 基准 · 核验 2026-07-14
按需查阅的原始材料
- Writing effective tools for AI agents - with AI agents ↗Anthropic · 核验 2026-07-23
- Create custom subagents ↗Anthropic · 核验 2026-07-23
- Effective harnesses for long-running agents ↗Anthropic · 核验 2026-07-23
- Demystifying evals for AI agents ↗Anthropic · 核验 2026-07-23
- Harness engineering: leveraging Codex in an agent-first world ↗OpenAI · 核验 2026-07-23
- Tracing - OpenAI Agents SDK ↗OpenAI Agents SDK · 核验 2026-07-11
- Grok Build session orchestration loop(固定提交) ↗xAI · 核验 2026-07-23
- Hermes Agent tool-call validation and recovery ↗Nous Research · 核验 2026-07-23
- Hermes Agent budget, completion and cleanup finalization ↗Nous Research · 核验 2026-07-23
- Hermes Agent durable session finalization ↗Nous Research · 核验 2026-07-23
- How we built our multi-agent research system ↗Anthropic · 核验 2026-07-23
- A harness for every task: dynamic workflows in Claude Code ↗Claude by Anthropic · 核验 2026-07-23
- AI 产品经理(Agent Harness 产品方向) ↗DeepSeek · 核验 2026-07-23
- Towards a Science of Scaling Agent Systems ↗Google Research · 核验 2026-07-14
- AI Agents That Matter ↗Princeton NLP · 核验 2026-07-14
- Establishing Best Practices for Building Rigorous Agentic Benchmarks ↗NeurIPS · 核验 2026-07-14
- InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM Agents ↗ACL Anthology · 核验 2026-07-14
- Use Claude Code Desktop ↗Claude by Anthropic · 核验 2026-07-23