Autoregressive Generation

定义

Autoregressive Generation 是通过预测下一个token来生成文本的方式,是当前LLM的核心机制。这种方式在生成连贯文本方面表现出色,但在产生跨领域连接方面存在局限。

核心要点

自回归的工作原理

自回归生成是逐步预测下一个token的过程:

  1. 输入文本 → 预测下一个token
  2. 将预测的token添加到输入 → 预测再下一个token
  3. 重复直到生成完整文本

自回归的局限性

Grant Sanderson指出了自回归的根本问题:

"想象一下,你被锁在一个盒子里,与世界互动的唯一方式是收到一张纸条,有人问你:'你能预测接下来会发生什么吗?'你预测接下来会发生什么,然后你的记忆被清除。你收到另一张纸条。想象这种情况发生了很多次,然后在另一边出来什么。他们说:'看看你写的这篇文章。'你可能会看着它说:'这太糟糕了。这不是我写的那篇文章。'"

关键问题

  1. 上下文依赖:自回归是预测下一个token,而跨领域连接本质上是低概率事件
  2. 缺乏全局视野:每次只预测下一个token,难以考虑整体结构
  3. 难以产生意外连接:跨领域连接是低概率事件,自回归难以产生

如何克服自回归的局限

Grant Sanderson提出了几种方法:

  1. 系统性地增加熵:尝试不同的方法,包括证明和反驳
  2. 并行运行多个agent:每个agent有不同的上下文和偏见
  3. 重置上下文:当陷入错误的思维链时,重新开始

"在所有数字思维的优势中,这可能实际上是其中之一:一种更系统化的方法来刷新你的思维。"

自回归vs扩散模型

维度自回归扩散模型
生成方式逐步预测下一个token从噪声逐步去噪
全局视野弱(逐步生成)强(同时考虑整体)
连接能力弱(低概率事件)强(可以同时考虑多个元素)
应用文本生成图像生成

关键数据点

  • 自回归是当前LLM的核心机制
  • 跨领域连接是低概率事件,自回归难以产生
  • 扩散模型在图像生成中表现出色,可能在未来文本生成中也有应用
  • 系统性地增加熵和并行运行多个agent可以克服自回归的局限

前提与局限性

  • 前提:自回归是当前LLM的核心机制
  • 前提:自回归在生成连贯文本方面表现出色
  • 局限:自回归难以产生跨领域的"闪电般连接"
  • 局限:自回归缺乏全局视野,难以考虑整体结构

关联概念

来源