Five Diagnostic Outcomes for Skill Eval

定义

Five Diagnostic Outcomes for Skill Eval 是 Google DevRel 提出的 skill vs baseline agent eval 诊断框架:当评估"加入 skill 后 agent 表现是否改善"时,结果不能只看总分,应按 (accuracy 方向) × (cost 方向) 分类为 5 种结果,从 High-Efficiency Capability Lift(skill 同时改善 accuracy 和 cost,最理想)到 Context Overload & Skill Regression(skill 拖慢且表现错,最失败),每种对应不同的下一步 audit 行动。

5 种结果(按 outcomes 优劣排序)

#结果accuracycost含义下一步
1High-Efficiency Capability Lift↑↓skill 同时提升 accuracy 和降低 costpromote skill 进入 product skill set
2Capability Lift(cost-neutral)↑→skill 提升 accuracy 但成本不变audit skill 内容是否真生效
3Cost-Only Lift→↓skill 不改善 accuracy 但显著降成本视场景决定——若业务关键 accuracy 则无价值
4Cost Bloat→↑skill 不改善 accuracy 但显著增成本删除或重写 skill 描述
5Context Overload & Skill Regression↓↑skill 退化 accuracy 且增加 cost删除并调查 skill 描述是否误导 agent

评估者使用流程

跑 skill vs baseline eval
    ↓
获得 (accuracy_delta, cost_delta) 二元组
    ↓
映射到 5 种结果之一
    ↓
按结果执行对应 audit / promote / delete 行动

与 Inspect AI 的具体映射

评估层数据源决策项
Macro viewinspect view GUI按 model 分组观察 accuracy 与 token/duration
Sample-levelTranscript tabskill 是否被 activate;reasoning loops vs 环境噪声
Scoring tabmulti_scorer 输出哪些 fact 错、是否系统错还是边界错

与 Evaluator Miscalibration 的关系

Evaluator-Miscalibration 关注评估器本身的校准错误(rubric 冲突、锚点 game);本文关注评估对象(skill 表现)的诊断分类。两层互补:先校准评估器(避免看错),再看诊断分类(避免做错决定)。

关键数据点

  • Google DevRel 在 Gemini 3.5 vs 3.6-flash × skill 4-way sweep 中观察到多种结果
  • 所有 case 都改善或打平 accuracy,但也全部增加 duration——意味着 skill 的 cost 副作用一致存在,被 score-improving 掩盖
  • gcloud skill 在 3.5→3.6-flash 时 accuracy 略降——属于 Context Overload 或 Skill Regression 的轻量版本

前提与局限性

  • 5 种分类未覆盖完备性:可能遗漏"skill 改变 skill activation 模式"等元层影响;可能存在"完全无效"(accuracy 与 cost 都无变化)的第 6 种
  • 依赖 decoupled grader 准确:5 种结果的前提是 grader 评分与 ground truth 接近;rubric 不准则分类错
  • 样本量与统计 confidence:单次 sweep 不足以稳健分类;置信区间宽时需重跑扩大样本
  • skill activation 先决条件:若 skill 未被 agent 激活,eval 实际测的是 baseline——5 种结果应在 activation verified 后才有意义
  • 未量化各 case 比例:5 种结果在大型 skill library 中的分布未公开;无法判断哪种是常见情况

配套机制

  • Skill Ingestion Check:transcript tab 验证 agent 是否真的激活了 skill(否则 eval 测的是 baseline 知识)
  • Sample-level diagnostics:从 high-level 总分下钻到单 sample 看 transcript + scoring
  • Sandbox noise vs model reasoning:区分推理 loop(agent 责任)和环境噪声(沙箱责任)

关联概念