HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution
编译摘要
1. 浓缩
- 核心结论 1:自演化首先需要把“执行、评估、修改、接受修改”拆成可归因对象。
- 关键证据:HarnessEvolve 用 execution / evaluation / optimization / gating 四模块处理完整 harness,而不是让一个循环既改自己又给自己打分。
- 核心结论 2:terminal score 不足以进行可靠 credit assignment。
- 关键证据:系统用已知 ground-truth answer 生成 reference trajectory,再核验其路径合法性,并定位 failed trajectory 的 first divergence。
- 核心结论 3:性能晋级至少需要防 shortcut 与防 forgetting 两类 gate。
- 关键证据:quality gate 检查 data leakage / prompt bloat;performance gate 要求当前 batch 提升且近期 batch 不明显退化;epoch 结束再从 snapshot pool 用 validation set 选择版本。
2. 质疑
- reference trajectory 来自同一个 execution agent 在已知答案条件下运行,即便另有 evaluation agent 核验,也不能自动视为外部独立真值。
- gate 的“结构解耦”不等于 gate 具有不可修改的独立安全权限。
- validation snapshot selection 是实验内版本选择,不等于 production canary / rollback。
3. 对标
关联概念