Continual Learning(持续学习)

定义

Continual Learning 是 AI 系统在运行中吸收新经验、整合进已有知识、并保持旧能力的能力。它要解决的不是“能不能记住更多文本”,而是系统能否随着环境变化稳定更新自己,同时避免灾难性遗忘和上下文污染。

为什么重要

当前大模型大多是 stateless 的:模型权重不会因为某个项目、某个用户、某个实验失败而自然更新。工程上常见的补丁是把更多内容塞进上下文窗口,或把经验写进外部 memory、wiki、skills、数据库,再在需要时检索。

这些方法能缓解问题,但还不等于持续学习。更长上下文只是更大的工作记忆;它会把重要信息、错误信息、过时信息和噪声一起带入推理。真正困难的是:什么时候该学、学到哪里、如何检索、如何验证、如何忘记,以及新经验是否会破坏旧能力。

关键数据点

  • Hassabis 把持续学习、长期推理、记忆和一致性列为当前 AGI 路线的关键短板。
  • 他用海马体和睡眠回放解释生物智能如何整合经验:大脑在睡眠,尤其是 REM 阶段回放重要情景,把新经验融入已有知识结构。
  • DeepMind 的早期 DQN 从神经科学借鉴了 experience replay,通过反复回放成功轨迹来学习 Atari 策略。
  • 单纯扩大上下文窗口不足以解决问题。实时视频会迅速消耗百万 token;更大的问题是检索相关经验的成本,而不是能不能存下所有内容。
  • 架构有机性缺失(Koray Kavukcuoglu, 2026-05):当前模型架构(如 MoE 专家混合)结构过于统一——"lots of experts, they're all very similar structure"。Koray 认为需要"更有机的(organic)"、更灵活的架构来实现真正的持续学习,但"we are not doing that yet"。
  • Self-learning 预测(Koray, 2026-05):预测 IO 2027 前后,模型将在实验层面参与改进自身的部分——"rely on the models to improve different parts of Gemini"。Jeff 补充这将是在人类指导下的自我改进("under the guidance of researchers")。
  • 缺乏持续学习会限制 Agent 的 fire and forget 能力:Agent 可以完成任务片段,但很难长期适应一个具体组织、项目或科学问题空间。

与工程补丁的边界

机制能解决什么仍缺什么
长上下文窗口把更多当前材料放进工作记忆不会自动区分重要、错误、过期和噪声
RAG / 向量检索运行时找回相关材料检索结果不等于知识整合
Multi-Layer-Memory跨会话保存经验和规则仍需人工或 harness 设计晋升、清理和验证机制
LLM-Wiki把原始材料编译为稳定知识层主要是外部知识系统,不是模型权重级学习
Continual Learning系统随经验更新内部能力仍是开放研究问题,可能需要架构突破

跨代累积学习与部署中的在线学习(Dwarkesh 圆桌,2026-09)

圆桌提供了一个重要拆分:今天所谓“模型从使用中学习”,很多发生在跨代预训练、中期训练、蒸馏和部署轨迹回流,而不是每个线上模型即时更新权重。前者可以把多轮实验和用户反馈汇入下一版模型,后者却要面对非平稳任务、反馈噪声、一次 rollout 的高方差和新旧能力回归。

嘉宾还区分了学习信号:SFT 或蒸馏适合传递行为和明确轨迹,但连续微更新可能造成灾难性遗忘与整体退化;RL 更适合传递能力信号,却不自动把显式知识稳定写入模型。LoRA/cartridge 等模块化方案可以延迟整合、保留可回滚性,但不等于解决长期知识整合。

判断(综合判断):持续学习的第一工程问题不是“能不能更新权重”,而是“哪类经验、以什么粒度、经过什么验证,才有资格改变长期能力”。跨代累积回路可能先于部署在线回路成熟。

证据:圆桌 00:45:24–01:18:03 对部署数据、hive mind、非平稳真实任务、样本效率、灾难性遗忘和模块化适配的讨论(见 20260911-dwarkesh-recursive-self-improvement-debate)。

边界:嘉宾没有给出统一的在线学习方案或独立 benchmark;外部记忆、蒸馏、模块加载和权重级 continual learning 的效果不能从这场讨论中互相推出。

科学过程 lineage:持续学习的 experience substrate(2026-10)

20261009-latentspace-periodic-synthesis-superintelligence 提供了一个很具体的“什么经验值得长期学”的物理科学案例。Periodic 不只保存最终实验结果,而是把 conversations、scientist intuitions、实验执行、computations、代码、negative/null results、instrument context 与多轮 campaign 轨迹连成 lineage;同时按时间冻结某一时刻的 evidence state,用这些状态构造后续 RL / training tasks。

判断:持续学习之前还有一个更基础的工程层——experience 必须先成为可版本化、可追溯、带当时信息边界的训练资产。对开放世界任务,只保存最终 outcome 会丢失“当时知道什么、做了什么、为什么失败、什么变化导致后来成功”这些真正能迁移的结构。

  • 证据:20261009-latentspace-periodic-synthesis-superintelligence(00:53:16–01:06:06)。Fedus/Çubuk 明确强调训练目标应从 final output of science 转向 process of doing science,并讨论 timestamped experimental evidence、negative results 与 campaign-level reasoning traces。
  • 边界:这仍不是部署中的 online continual learning。访谈没有展示模型每做完一个实验就安全更新权重;这里证明的是高质量 experience substrate / offline training pipeline 的设计价值。negative result 也必须绑定具体实验条件,因为一次 synthesis 失败不等于目标永远不可实现。

这进一步细化了本页前述判断:长期能力更新的关键不只是 replay “成功轨迹”,而是决定哪些状态—行动—证据—失败序列有资格进入学习回路,并保留足够 provenance 让未来模型知道当时可见的信息边界。

与 Agent 知识管理的关系

Agent 知识管理是持续学习的工程近似:用 raw、wiki、memory、skills、lint 和人类策展模拟“长期学习”。它的价值在于让 Agent 不必把所有知识塞进当前上下文,而是通过可版本化、可审查的外部层积累经验。

但这仍是外部化的持续学习。真正的 Continual Learning 要求系统能在长期任务中更新 世界模型、保留有用经验、删除错误假设,并在新情境中迁移旧知识。

前提与局限性

  • 持续学习可能只需要现有范式继续 scale 和增量创新,也可能需要新的架构突破;当前证据不足以确定。
  • 生物启发提供了方向,但机器系统不必照搬海马体或睡眠机制。
  • 持续学习必须处理污染问题:错误经验被长期保存,比一次性幻觉更危险。
  • 对企业 Agent 来说,持续学习还涉及权限和治理:哪些经验可以进入长期记忆,谁批准,谁能删除,谁承担后果。

关联概念