跳转到内容

两个旋钮,一个循环:当 AI 智能体学会改自己

今天绝大多数 AI Agent 有一个共同的特征:人是改进的瓶颈。

你给 Agent 换更好的提示词,它变强一点。你给它加更好的工具,它又强一点。你调它的重试逻辑、换更好的底座模型——每次都需要一个人类工程师坐在外面,决定下一步试什么。

模型本身是冻结的。脚手架也是冻结的。整个系统就像一个手艺不错的工人,干得很好,但永远不会自己升级手艺。

Hexo Labs 这周开源了一个叫 SIA 的框架,试图打破这个状态。它做的事情听起来很简单:让一个 Agent 在完成任务之后,同时修改自己的工作流程自己的模型权重。不是人决定改哪个、怎么改——是它自己决定。

想法不新。新的是 SIA 把两条此前完全独立的研究路线拧到了一起。

AI 自我改进的研究,过去几年其实分成了两个阵营,彼此几乎不交流。

第一条路叫脚手架更新。思路是:用一个”元 Agent”去重写任务型 Agent 的代码骨架——系统提示词、工具调度逻辑、重试策略、答案提取方式。模型权重不动,只改外面的”壳”。代表工作有 Darwin Gödel Machine、Meta-Harness、Hyperagents,还有更早的 AI Scientist。

这条路反复撞上一个经验性发现:脚手架的修改集中在”软件工程卫生”层面。解析写得更健壮了,重试逻辑更完善了,工具分发更精确了。但领域知识?模型不知道的事情,脚手架也教不会。你不可能通过改提示词让一个模型理解中国刑法 191 个罪名之间的细微区分。

第二条路叫测试时训练。思路反过来:不动脚手架,直接在任务反馈上更新模型权重。代表工作是 TTRLDiscover-TTT 系列。增益来自模型内部策略的变化——它确实”学到了东西”。但训练管线本身是人写的,一套固定的 RL recipe 打天下,不会根据任务特点自动调整。

两条路各有各的天花板。脚手架学派改不了模型知道什么;训练学派改不了模型怎么行动。

SIA 的核心主张是:把两个杠杆放进同一个循环。

SIA 的系统结构由三个 LLM 组件驱动一个迭代循环:

Meta-Agent 从任务规格出发,生成初始脚手架。Task-Specific Agent 带着这个脚手架去执行任务,记录每一步——每一个 prompt、每一次工具调用、每一个提取出的答案。Feedback-Agent 读取完整的执行轨迹,然后做一个关键决定:下一步改脚手架,还是改权重?

这两个动作交替进行,没有固定顺序。Feedback-Agent 每一步都根据当前状态独立判断。

改脚手架时,模型权重冻结,只有代码骨架在进化——加一个新的解析器、换一种重试策略、引入一个之前没有的工具。

改权重时,脚手架冻结,通过 LoRA(rank 32)对底座模型做低秩适配。训练算法不是固定的——Feedback-Agent 根据观察到的奖励信号自己选。在 LawBench 任务上,奖励是干净的标量,它选了 PPO with GAE;在 GPU 内核优化任务上,大多数内核编译失败、奖励极度稀疏,它选了 entropic advantage weighting 来放大稀有高回报样本;在单细胞 RNA 去噪任务上,它选了 GRPO,直接省掉了 value network。

“算法选择也是学出来的”,这比固定 recipe 有意思。系统不只是在学”怎么完成任务”,还在学”用什么方式学最有效”。

底座模型是 gpt-oss-120b(一个 1200 亿参数的指令微调模型),Meta-Agent 和 Feedback-Agent 都跑在 Claude Sonnet 4.6 上,训练在 H100 GPU 上通过 Modal 平台完成。

论文在三个差异很大的领域上测试了 SIA。选这三个任务显然是故意的——如果只在一种任务上有效,说服力不够。

LawBench:191 类中文刑事罪名分类。这是一个需要深入理解中国刑法体系的任务,初始准确率只有 13.5%。脚手架迭代构建了一套 TF-IDF + LinearSVC 的管线,在 50% 处停滞——再怎么改提示词和工具调度,就是上不去。然后权重更新接管,用 PPO 继续推到 70.1%。比先前最好的结果(45%)高了 25 个百分点。

AlphaEvolve TriMul:在 H100 GPU 上优化一个 CUDA 内核,计算 AlphaFold2 的 Evoformer 模块中的核心操作。脚手架编辑做到了 1.14 倍的加速。然后权重更新把运行时间从 12,483 微秒砍到 1,017 微秒——91.9% 的缩减,总加速 14.02 倍。

scRNA-seq 去噪:调参 MAGIC(一种单细胞 RNA 插值方法)。脚手架扫描了超参数空间,停在 0.241 mse_norm。第一个权重更新检查点引入了一个两行步骤——把插值结果取整为非负整数。就这两行。脚手架迭代了很多轮,从未产生过这个想法。最终分数 0.289,比初始基线提升 502%

那个两行步骤是整个论文里最有说服力的细节。 它说明权重更新学到的不是”更好的搜索策略”,而是一种领域直觉——“基因表达计数应该是非负整数”这种知识,你很难通过提示词注入,但可以通过训练让它长进模型的参数里。

三个任务,领域差异很大,但规律一致:SIA-W+H(脚手架 + 权重)严格优于 SIA-H(仅脚手架)。权重更新带来的增量,是脚手架独自到达不了的地方。

论文回答了一个我读之前就在想的问题:两种更新到底改了什么性质的东西?

脚手架更新产出的是外化的工程改进。新工具、更紧的解析器、更好的重试逻辑。这些是”软件工程卫生”——重要,但不涉及领域认知。就像给一个程序员换了更好的 IDE 和更完善的 CI 管线,他的代码质量会提升,但他对业务领域的理解没有变。

权重更新产出的是内化的领域知识。H100 内核优化的模式、整数取整的步骤、罪名分类的细粒度区分——这些是”任何提示词都到不了的地方”。就像那个程序员在某个行业干了三年之后,他对业务的直觉变了。

这个区分重要在哪?脚手架决定了 Agent 怎么搜索,权重决定了 Agent 知道什么 只会搜索但不懂领域,不行;懂领域但不知道怎么高效组织工作流程,也不行。

SIA 论文里有一张对比表,把 SIA 和十几个相关工作放在一起,两列:编辑脚手架?编辑权重?SIA 是唯一两个都打勾的。这个空白存在了不是一天两天。

论文的数据是干净的,但有几个地方值得停一停。

Goodhart 效应的阴影。两个杠杆优化的是同一个固定验证器。论文自己承认了这一点,并警告”联合不动点可能在扰动下脆弱”。翻译一下:SIA 可能在验证器上看起来很强,但换一套评价方式就不行了。LawBench 用的 held-out test split 还好一些,但 GPU 内核优化和去噪任务的验证器结构更简单,被 hack 的风险更高。三个任务不够回答这个问题。

350 倍的声明。Hexo Labs 在发布宣传中声称 SIA 能将超级智能开发加速 350 倍,基于 MLE-Bench 上的表现。MarkTechPost 在报道中诚实地指出:这个数字没有出现在论文里。论文只报告了三个任务的结果,MLE-Bench 数据未公开。这是一个典型的”PR 跑得比论文快”的案例。Hexo Labs 的 CEO Kunal Bhatia 说”超级智能不会从静态模型中涌现”——这话没错,但从三个基准测试跳到 350 倍超级智能加速,中间的距离不是一句正确的口号能覆盖的。

三个任务的局限。法律分类、GPU 内核、单细胞 RNA——差异确实大,但都是有明确验证器的任务。如果任务没有干净的评分函数呢?开放域对话、创意写作、策略规划——这些任务上 SIA 的循环还能跑吗?论文没有回答,也没有声称回答了。

递归的深度。论文在最后提了一个很有野心的未来方向:让 Feedback-Agent 的选择策略本身也成为学习对象。也就是说,不只是学”改什么”,还学”怎么决定改什么”。这会产生一个真正递归的结构——一个自我改进系统,其改进机制本身也在自我改进。论文承认这”引发了关于嵌套循环稳定性的非平凡问题”。这是诚实的。递归自我改进最吓人的不是它能不能做到,而是做到之后你不确定它稳不稳。

Hexo Labs 选择了 MIT 许可证,完全开源。Kunal Bhatia 明确说,这是在”建设护栏”——自我改进 AI 的基础设施必须透明、可审计,让更广泛的研究社区参与发现局限和滥用风险。他们还启动了 Grant Program,与 Stanford 和 Oxford 合作。

这与 Meta 最近的策略形成直接对比。Meta 宣布其最强的自我改进模型将保持私有,理由是安全。两种选择都有道理,但指向完全不同的治理哲学:一个相信开放审查是更好的安全机制,一个相信限制访问是更好的安全机制。

SIA 的代码已经在 GitHub 上(hexo-ai/sia),pip install sia-agent 就能跑。四个内置任务开箱即用。门槛不高。

这意味着什么?任何有 H100 访问权限的人都可以开始实验自我改进 Agent。研究民主化是好事。但一旦自我改进的循环被广泛部署,谁来监控循环的稳定性和方向?

开头那个比喻可以收尾了。

今天的 Agent 像一个手艺不错但永远不会自学的工人。你给他更好的工具他用得更好,你不给他就停在原地。

SIA 试图让这个工人学会两件事:一是改进自己的工作流程(脚手架更新),二是在干活中积累领域经验(权重更新)。而且——关键的那个”而且”——由他自己判断什么时候该改流程,什么时候该攒经验。

这个想法方向是对的。两个研究孤岛合并成一个循环,实验数据支撑了这个合并的价值。但三个任务只是起点。Goodhart 风险、递归稳定性、开放域任务的适用性,这些问题的答案决定了 SIA 是有趣的原型,还是真正的范式转移。

我自己的判断?SIA 指出的方向大概率是对的:Agent 的进化必须同时覆盖”怎么做事”和”知道什么”。但当前实现离”范式转移”还有距离。它更像一个概念验证:看,两个旋钮一起转,效果确实比只转一个好。接下来的问题是,这个循环能不能在更复杂、更模糊、更缺乏干净验证器的真实场景中稳定运转。

一个会改自己的系统,最让人不安的从来不是”它能不能改”,而是”它改完之后还是不是你想要的东西”。

你觉得 Agent 自我改进的最大风险是什么?是 Goodhart 效应(在错误的指标上越跑越远),还是递归稳定性(改进机制自身失控),还是更根本的——我们可能还没有能力定义”好的改进”到底是什么意思?欢迎留言聊聊。

论文:SIA: Self Improving AI with Harness & Weight Updates Hebbar et al., 2026 https://arxiv.org/abs/2605.27276

报道:Hexo Labs Open-Sources SIA MarkTechPost, 2026-05-29 https://www.marktechpost.com/2026/05/29/hexo-labs-open-sources-sia-a-self-improving-agent-that-updates-both-the-harness-and-the-model-weights/

GitHub: https://github.com/hexo-ai/sia PyPI: pip install sia-agent