NLAH(Natural-Language Agent Harnesses)

定义

将 Agent 驾驭策略从代码中外置为可执行的自然语言文档,由智能驾驭运行时(IHR)解释执行,使驾驭模式可检视、可移植、可消融。

关键数据点

  • 核心论文: 《Natural-Language Agent Harnesses》,提出 NLAH + IHR 双层架构
  • 性能等效: 在 SWE-bench Verified、Terminal-Bench 2.0、OSWorld 三类基准上,IHR 执行的 NLAH 取得与代码驾驭层相当的成绩
  • 策略压缩: Live-SWE 从 6.01 万 token 代码降到 2.9k token 的 NLAH(压缩约 20 倍);MHTBA 从 1.05 万降到 0.8k
  • 代价: 当前原型运行时的 token/调用开销更高
  • 消融发现: 文件持久化状态是最稳正贡献(Δ 约 +2.6/+13.9);多候选搜索和上下文压缩反而有害;自我进化模块提升性能但 token 消耗大幅上升

四层架构

职责比喻
基础智能体最小 agent 循环(LLM + 终端工具),不含任务逻辑
运行时策略(IHR)固定 NL 指令,读取 NLAH 文档、调度子 agent、管理状态骑手
NLAH 文档可替换的自然语言驾驭策略(阶段、角色、状态、验收、恢复、停止)路线图
脚本与适配器确定性硬逻辑(JSON schema 校验、diff 计算、格式转换)信号灯

三种驾驭方式谱系

从控制强到弱:

  1. 代码驾驭层(Code Harness): 程序逻辑硬性控制,最强确定性但策略与实现交织
  2. NLAH + IHR: 自然语言承载策略 + 运行时解释执行,放弃硬确定性但获得可编辑性和可消融性
  3. 自驾驭(Self-Harnessing): 控制器模型直接驾驭其他模型,无外部驾驭层

前提与局限性

  • 前提: NLAH 假设驾驭策略可以被自然语言充分精确地表达,且 LLM 能忠实遵循
  • 机制遵循不均: 契约式、可即时验证的机制遵循度高;跨阶段、跨子 agent 协调的机制遵循度低
  • 自然语言不精确性: 语义约束可能被欠定义、被不同模型不同解读
  • 安全风险: 可移植的驾驭逻辑可能降低传播危险工作流的门槛;驾驭层中介工具使用,可能引入提示注入和供应链污染攻击面

关联概念