A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges

编译摘要

1. 浓缩

  • 核心结论 1:模型数量增加不等于验证信号独立。
    • 关键证据:论文在 18 个 LLM、6 个模型家族上测得显著 behavioral entanglement,并用 BEI/CIG 刻画同步错误与错误回答的方向性依赖。
  • 核心结论 2:这种依赖与 judge 过度认可偏差相关,而且能跨 benchmark 转移。
    • 关键证据:MMLU-Pro 上 BEI/CIG 与 over-endorsement 的相关系数分别为 0.508/0.520;MATH-500 上为 0.441/0.457,均达到作者报告的统计显著性。
  • 核心结论 3:显式降低高纠缠 verifier 的权重可以改善 ensemble。
    • 关键证据:de-entangled reweighting 相比 majority voting 提高 3.5 个百分点 accuracy、2.6 个百分点 precision。

2. 质疑

  • 论文证明的是行为依赖与 judge bias 的统计关联,不是“所有同源模型一定共错”的因果定律。
  • 它操纵/测量的是输出行为层依赖,没有固定并交叉操纵证据访问、reference、执行环境和时间隔离,因此不足以单独证明 EX-001 的“四轴最弱轴”模型。
  • 相关性在 MMLU-Pro/MATH-500 成立,不应直接外推到所有 tool-using agent 或生产工作流。

3. 对标

  • 对 Verifiable-Agent-Engineering:补上“验证器本身可能相关失效”的独立门;多模型投票只有在信号足够去相关时才有额外价值。
  • 对 EX-001:支持把 verifier independence 保留为独立变量,但还需要与证据覆盖、reference integrity、执行真值做同轨交叉。
  • 对 LLM-as-a-Judge:模型规模与家族标签不是 independence 的可靠代理,实际应测共同错误结构。

关联概念