Agent 评估与可观测性
用任务结果、执行轨迹、工具行为、安全边界、成本和人工判断,持续判断 Agent 是否可靠完成目标的工程体系。
可观测性回答“Agent 实际做了什么”:模型调用、tool call、参数、observation、状态变化、handoff、耗时、错误和预算。评估回答“这些行为是否足够好”:任务是否完成、证据是否正确、工具是否选对、风险是否受控。
两者相互依赖但不等同。只有 trace 没有成功标准,只能回放;只有最终分数没有 trace,难以定位为什么失败。
Agent 评估比普通问答更难,因为同一任务可能存在多条有效路径,错误会跨多轮累积,工具和外部环境也会变化。
“Demo 成功一次”不能证明系统可靠。Agent 可能:
- 最终答对,但调用了不必要或高风险工具。
- 选对工具,却生成错误参数。
- 在一次环境状态下成功,换一个状态就陷入循环。
- 输出语言看似合理,但没有真正改变外部系统。
- 完成任务,却花费不可接受的时间和调用成本。
- 在高风险动作前没有请求人类确认。
只有持续评估才能判断复杂度、框架或模型升级是否真正改善结果。
从真实使用场景采样正常案例、边界案例、历史失败和对抗输入。每个任务应记录初始环境、允许工具、成功条件、禁止动作和预算。
- Task success / resolution rate。
- 最终答案准确性与证据支持。
- 外部状态是否达到目标。
- 人工接受率、返工率和升级率。
- 安全违规与未授权动作数量。
- 工具选择准确率。
- 参数正确率和 schema 合法率。
- 无效或重复调用次数。
- 计划覆盖与关键步骤遗漏。
- 是否正确处理错误、重试和停止。
- 是否在规定检查点请求 human-in-the-loop。
- 延迟、token、工具成本和总运行成本。
- timeout、crash、外部依赖失败率。
- 不同模型、prompt、工具版本之间的回归。
- 并发、限流和长时运行稳定性。
在固定任务、环境快照或 mock tool 上运行,可重复比较模型、prompt 与代码版本。适合回归测试和发布门槛,但可能低估真实环境漂移。
在真实流量中观察成功率、人工接管、投诉和安全事件。可采用 shadow、canary 或小比例实验,不能直接让未经验证的 Agent 获得高权限。
Component 与 end-to-end
Section titled “Component 与 end-to-end”Component eval 分别测试 routing、retrieval、tool selection、参数生成和 evaluator;end-to-end eval 检查完整任务。前者便于定位,后者防止局部指标好但系统失败。
自动评审与人工评审
Section titled “自动评审与人工评审”精确答案、状态变化和工具调用优先用确定性检查。LLM-as-judge 可用于开放文本,但应通过人工样本校准,避免评审模型共享被评系统的盲点。高风险领域仍需专家审核。
早期 Agent 展示偏重一次性 Demo。API-Bank、BFCL、GAIA 等基准分别推进工具调用、多工具与真实世界任务评估。随着 Agent 进入生产,trace/span、在线监控、trajectory eval、sandbox 和权限审计成为必要部分。
当前趋势是把 eval 放在开发前:先定义成功和失败,再选择模型、工具和 orchestration;而不是系统完成后才寻找一个总分。
“最终答案正确就够了”
Section titled ““最终答案正确就够了””高风险系统还必须检查动作路径、权限、来源、成本和可恢复性。
“Trace 就是 Eval”
Section titled ““Trace 就是 Eval””Trace 是事实记录,Eval 需要标准、标签和判定逻辑。
“一个 benchmark 分数能代表生产效果”
Section titled ““一个 benchmark 分数能代表生产效果””公开基准有固定分布,生产任务和工具环境不同。需要自有任务集和真实失败样本。
“LLM Judge 可以替代人工”
Section titled ““LLM Judge 可以替代人工””评审模型可能偏好相似文风、忽视专业错误或被 prompt injection 影响。它是扩展评审的工具,不是最终安全边界。
“只测成功案例”
Section titled ““只测成功案例””边界、权限、工具故障、超时和恶意内容往往决定生产可靠性。
“指标越多越成熟”
Section titled ““指标越多越成熟””指标必须能驱动决策。最有价值的是能定位失败组件、判断是否发布和验证改动收益的少量指标。
与相邻概念的区别
Section titled “与相邻概念的区别”- 与 logging:日志记录事件;可观测性建立跨调用的 trace、state 和因果关系。
- 与 unit test:单元测试验证确定性组件;Agent eval 还要处理随机性、多路径和环境交互。
- 与 benchmark:benchmark 是标准化任务集;完整评估还包括自有数据、在线信号和风险审计。
- 与 guardrail:guardrail 在运行时阻止或升级危险行为;eval 判断 guardrail 和整个 Agent 是否有效。
- 与 monitoring:monitoring 关注线上状态;eval 同时覆盖离线开发、回归和发布决策。