AI 原理深度史 · 交互式讲解(扩厚版)
主题

人工智能:一部"为什么"的思想史

不堆定义,只讲因果。每个概念都回答:当时卡在什么问题、人们洞察到什么、才发明了什么方法、为什么有效、还留下什么未解之谜。按真实时间线推进。

1986→2012BP 等了 GPU 26 年
2017Transformer 问世
175BGPT-3 参数
671B/37BDeepSeek 总/激活参
Prologue

怎么读这份"原理史"

下面不是百科词条,而是一条因果链:后一个突破,几乎都是被前一个的"未解问题"逼出来的。我们按年份推进,每一节统一用五段式拆解。

统一的拆解模板

① 背景问题

当时卡在什么具体困难上?

② 关键洞察

人们想通了什么,才破局?

③ 方法诞生

据此发明了什么机制/算法?

④ 为何有效

它为什么真的管用?

⑤ 遗留/争议

还留下什么没解决的?

⤷ 时间锚

每节都钉在真实年份上。

一句话主线:符号主义碰壁 → 连接主义等来 GPU → RNN 三硬伤逼出注意力 → Transformer 把"可并行缩放"打通 → 于是能堆规模 → 预训练范式、GPT-3 质变、涌现之谜、缩放定律依次登场 → "会说话≠说人话"逼出后训练对齐 → CoT/o1 让模型学会思考 → DeepSeek 把成本打下来。

一张"问题 → 方法"的因果地图

[符号主义碰壁]
└─ 连接主义靠 BP 复兴,但深层网络"训不动"
└─ 2006 逐层预训练 / 2012 GPU+数据 → "深度可训"
└─ 序列任务卡在 RNN/LSTM:不能并行 + 长程依赖衰减
└─ Bahdanau 注意力(2014):信息不该压成定长向量
└─ Transformer(2017):纯自注意力,可并行+任意远依赖
├─ 既然能并行可缩放,就"堆规模"
│ ├─ 预训练范式(2013–19)
│ ├─ GPT-3(2020):规模→少样本"质变"
│ ├─ 涌现之谜:为何平滑损失下能力"跳变"
│ ├─ 缩放定律(2020–22):把"大力"量化
│ └─ 训练侧变贵 → 测试时缩放(2024)
└─ 模型会说话≠说人话 → 对齐问题
  ├─ InstructGPT/RLHF(2022):用"偏好"替代"标准答案"
  ├─ DPO(2023):去掉奖励模型
  └─ CoT(2022)→o1/R1(2024–25):让模型"学会思考"
└─ 要便宜 → DeepSeek(2024–):MoE+FP8+对齐蒸馏

提示:右上角可切换「护眼 / 日间 / 夜间」三套低对比主题;每个交互组件都可点击/拖动。读到最后你会发现——所谓"AI 爆发",不过是一连串"老洞察 + 新规模"的再兑现。

1950s – 2012

史前与奠基:深度学习的"迟到"

今天所有的"爆发",根子都埋在 1950–2012 这六十多年。这一阶段的主角是连接主义:它很早就有了正确方向,却等了二十六年才等到能跑起来的硬件与数据。

1.1 符号主义与两次寒冬:为什么连接主义后来居上

1956 年达特茅斯会议提出"人工智能"一词,当时主流是符号主义:用人工写好的逻辑规则、if-then 表达式让机器推理。它天然符合人类"思考=操纵符号"的直觉,早期在棋类、定理证明上也有过亮眼表现。

但它卡在一个致命问题上——知识获取瓶颈:真实世界的规则多到写不完,而且规则之间极易冲突。想让机器理解一句话,你几乎要手写完人类全部的常识。这意味着符号系统无法规模化:人写多快,它才多强。

于是 1970 年代、1980 年代两度进入"AI 寒冬"——承诺过高、成效不足,经费断流。这两次寒冬留下一句沉甸甸的教训:没有足够的数据与算力,连接主义(从数据中拟合,而非编程)只是空想。也正因为如此,后来"规模化"会成为一条被反复验证的真理。

关键洞察:智能也许不该来自"显式规则",而该来自"大量简单单元通过可调参数涌现出的行为"。这一句话,是后面一切的连接主义种子。

1.2 反向传播(1986):一个领先时代 20 年的洞察

要让多层网络从错误里学习,必须知道"每一层的权重该往哪调"。Rumelhart 等人在 1986 年把链式法则系统化,提出反向传播(Backpropagation):先正向算一遍输出,再把误差从输出层一层层往回传,算出每个权重的梯度。

这在数学上解决了"深层网络怎么端到端训练"的根本问题。但讽刺的是——它当时根本跑不起来。原因有三:① 没有大规模标注数据;② 没有 GPU,CPU 算一个中等网络要几天;③ 网络一深就"梯度消失",训出来的效果和浅网络没两样。

遗留/争议:反向传播是不是大脑的工作方式?至今仍有争论。但它作为"工程上可训练的优化方法"已经足够成功——这提醒我们:一个方法可以先"够用"地成功,再慢慢补全"像不像人脑"的解释。

1.3 2006 逐层预训练:这是"预训练"思想的远祖

到了 2006 年,Hinton 用深度信念网络(DBN)给出一记重击:深层网络直接端到端硬训会陷入局部最优、梯度消失;那不如先用无标注数据"逐层贪心预训练",让每一层先学一个不错的初值,再整体微调。

这一步的意义,怎么强调都不过分——它等于在 2006 年就承认了一条核心理念:"先学会通用的、底层的表示,再去做具体任务",比"从零直接训任务"稳得多。请注意,这股"先通用后专用"的思想基因,六年之后直接演变成了 BERT / GPT 的预训练范式(见第 4 节)。今天随口说的"预训练",和 2006 年的"逐层预训练"是同一灵魂的两次落地

为什么有效:好的初始化让优化景观变得更"平缓好走";无标注数据近乎无限,于是预训练阶段几乎不花标注成本,就把通用结构学会了。

1.4 2012 AlexNet:第一次证明"数据+GPU+梯度"能碾压人工

2012 年,Krizhevsky、Sutskever、Hinton 用 AlexNet 在 ImageNet 图像分类上把第二名远远甩开。它的"秘密"不是某个惊世算法,而是把几样成熟零件组合对了:卷积(局部感知、权值共享)、ReLU 激活(缓解饱和、让梯度流得更顺)、Dropout(随机丢弃神经元、防过拟合)、以及用 GPU 把训练从"天"压到"天量级但可行"。

它确立的不是某个网络结构,而是一整套范式:只要数据够大、算力够猛、用梯度下降去拟合,就能超过人类手工设计的特征。这条范式,正是后面所有大模型"大力出奇迹"的方法论前身。

遗留/争议:AlexNet 也暴露了深度学习自此背上的一个包袱——它极度依赖数据与算力。这既是后来"缩放定律"成立的前提,也是"小团队玩不起"的焦虑源头。

① 失败/淘汰路线:符号主义的退场

为什么符号主义最终让位?因为它把"智能"绑死在"人类手写规则"上,而规则无法规模化。专家系统(如 1980 年代的 XCON)在窄领域管用,但维护成本随规则数指数上升,遇到没见过的情形就束手无策。连接主义则把"写规则"换成"从数据里学参数",可扩展性发生了质变——这正是历史选择的真正分水岭。

1997 – 2014

序列模型的困境:Transformer 为什么会被发明

图像用 CNN 解决了,但语言、语音、时间序列是"顺序"的,需要"记住前文"。RNN/LSTM 顶了一阵,却有三个硬伤,正是这三个硬伤,一步步逼出了注意力,最终逼出了 Transformer。

2.1 RNN / LSTM 解决了什么,又卡在哪里

1990 年代起的 RNN(循环神经网络)用一个"隐状态"在每一步之间传递记忆,让模型能处理变长序列。LSTM(1997)进一步引入"门控"(输入门、遗忘门、输出门),大幅缓解了梯度消失,能记住更长的上下文。

但 LSTM 只是"缓解",不是"根治"。它有三个结构性硬伤,每一个都后来被 Transformer 的某个设计精准针对:

硬伤一

顺序计算,无法并行。第 t 步必须等第 t−1 步算完,GPU 成千上万个核心只能干瞪眼。这意味着训练极慢,模型规模被死死卡住。

硬伤二

长程依赖衰减。句子开头的信息要穿过很多步才能到达结尾,每过一层都被"稀释"一点,句子一长为传递不到而失效。

硬伤三

记忆瓶颈。所有历史被压缩进一个固定大小的隐状态向量,信息会"漏"——长句后半段常常忘了前半段说了什么。

记住这三个硬伤——Transformer 的每一个核心设计,几乎都是冲着其中某一个去的。理解了它们,Transformer 就不是"天上掉下来的架构",而是"被问题逼出来的解"。

2.2 Bahdanau 注意力(2014):信息不该被压成定长向量

在机器翻译里,传统做法是编码器把整句源文压成一个定长向量,解码器只能从这个向量生成整句译文。句子一长,一个向量根本装不下,翻译质量雪崩。

Bahdanau 等人提出一个现在看来理所当然、当时却极巧妙的改动:不要让解码器死盯着一个向量,而是在生成每一个目标词时,"回头检索"最相关的那些源词。具体做法是,对编码器的所有隐状态算一组"注意力权重",加权求和得到"上下文向量"。

这一步把"全局压缩"换成了"动态检索",长句翻译质量立刻显著提升。但注意——它仍然跑在 RNN 之上,只是给 RNN 打了一个补丁,并没有解决"不能并行"这个最根本的硬伤。补丁虽好,根病未除。

关键洞察(这一句最值钱):信息不该被压成一个定长向量,而应在需要时"按需检索"。注意力,本质就是一种软性的、可微的检索机制
2017

Transformer:自注意力如何"一统江湖"

既然注意力这么好,那能不能干脆去掉 RNN,只用注意力?2017 年 Google 的《Attention Is All You Need》给出了肯定答案,并顺手解决了 RNN 的全部三个硬伤。

3.1 三个洞察(为什么是这三点)

① 自注意力(Self-Attention)。不让"编码器→解码器"单向检索,而是让序列里每个词同时去看所有其他词,用 Q/K/V 算相关性。这把"任意两个位置"的距离压成了 O(1) 步(RNN 是 O(n)),长程依赖被一击破解。

② 位置编码。去掉 RNN 后,模型本身不知道词序。于是显式注入"位置信息"(正弦编码或可学习向量),把"顺序"变成可学习的偏置,让模型既并行又知先后。

③ 纯注意力堆叠 + 残差/层归一化。用多头注意力并行看不同的"关系子空间"(语法、指代、语义……),靠残差连接让上百层也能稳定训练。

3.2 为什么有效(被低估的一点)

Transformer 最大的历史意义不是"效果更好",而是"可并行 + 可缩放"。它把语言建模变成了一个几乎完全能在 GPU 上做矩阵乘法并行的任务。

这等于为后面的"无脑堆规模"扫清了架构障碍:只要你砸算力,模型就能变大变强,不会因为"算不动"而触顶。换句话说——Transformer 是缩放定律能够成立的前提条件。没有它,规模化语言模型寸步难行。

为什么当时能成:它把 Bahdanau 的"检索"泛化为"任意两两关联的计算原语",并证明"不需要卷积、不需要循环也能做好序列任务",一个统一、简洁、可并行的架构自然成为所有大模型的底座。

3.3 交互:RNN 的顺序流 vs Transformer 的全连接

点"播放",对比两者处理同一个 5 词序列的路径:RNN 必须一步一步串行流过(路径长度随序列变长),Transformer 一步之内让所有词两两相连(路径长度恒为 1)。

RNN / LSTM(串行 · 不能并行)

Transformer 自注意力(全连接 · 一步并行)

路径长度:RNN = O(n),Transformer = O(1)

3.4 残差连接深入:为什么深层网络"敢"堆到上千层

Transformer 能堆上百层,靠的是残差连接(ResNet, He et al. 2015)。深层网络有个反直觉现象:不是过拟合,而是优化困难——层数越多,训练误差反而越大(退化问题),因为梯度在反向传播中逐层连乘,极易趋近 0(消失)或爆炸。

残差的做法极其优雅:不再让每层去学"完整的目标映射 H(x)",而是学"残差 F(x) = H(x) − x",输出变成 y = F(x) + x。这条"+x"的捷径(skip connection)让反向梯度至少保留一条"恒等路径"(≈1),信息可跨层直达,于是能稳定训练成百上千层。

观察梯度/信息流动:
Input x
F₁(x)
F₂(x)
+ x → y

有残差时,反向梯度至少包含一条"恒等路径"(≈1),信息可跨层直达,因此能训练成百上千层。

输出 y = F(x) + x  反向:∂L/∂x = ∂L/∂y · (∂F/∂x + 1) ← 那一项 "1" 就是梯度不消失的关键
2013 – 2019

预训练范式:人们为什么想到"先学通用表示,再适配任务"

"预训练"不是某个人的灵光一现,而是四步走出来的必然。下面按思想祖先链逐步推进。

4.1 远祖 word2vec(2013):词义 = 上下文

传统词表示是 one-hot(每个词一个独立向量,词与词之间毫无关系),模型根本学不到"国王 − 男人 + 女人 ≈ 女王"。2013 年 Mikolov 等人的 word2vec 提出一个朴素却深刻的假设——分布式假说:一个词的语义,由它周围经常出现的词决定

于是用"预测上下文词"这种自监督任务,把每个词压成稠密向量,语义相近的词在向量空间里自然靠近。这是第一次用"无标注文本 + 自监督"学到通用表示,奠定了预训练的第一个信念:海量无标注数据里藏着通用知识,可以先把它用起来

4.2 ELMo(2018):词意随语境而变

word2vec 每个词只有一个向量,"苹果(公司)"和"苹果(水果)"分不开。ELMo 的关键改进是:词意是上下文相关的。它用一个双向 LSTM 语言模型,把"整个句子的语境"编码进词向量——同一个词在不同句子里拿到不同向量。

方法上,它先训一个语言模型(自监督),再把它学到的隐状态当作"上下文相关词向量"接到下游任务头上。这已经是"预训练一个语言模型,再取它的表示"的雏形。

4.3 ULMFiT(2018):"微调范式"被正式命名

每个 NLP 任务都从零标数据训模型,小数据极易过拟合。ULMFiT 把一套方法论说清楚了:先在大规模通用语料上训一个语言模型(学到通用语言规律),再用少量标注数据"微调"到具体任务,并给出了分阶段、不同学习率等实用技巧。

它把"预训练→微调"从零散实践,变成了一套可复用、可教学的方法论。注意它和 2006 年 Hinton 的"逐层预训练"在精神上完全一致,只是手段从"无监督逐层初始化"进化成了"自监督语言建模 + 微调"。

4.4 BERT 与 GPT(2018–2019):两条路,同一灵魂

两者都意识到:标注数据贵、任务无穷多,而"预测文本本身"几乎免费从语料里长出来。于是它们用不同的"自监督借口任务"预训练:

BERT · 编码器

随机盖住部分词(MLM),让模型根据上下文猜被盖住的词 → 学到"双向理解",擅长分类、抽取、检索类任务。

GPT · 解码器

根据前文预测下一个词(自回归)→ 学到"生成",天然适合对话、创作、续写。

两条路看似相反,灵魂相同:用几乎免费的自监督,把海量文本里的通用语言能力先"存"进一个大模型,再便宜地适配到具体任务。

② 失败/淘汰路线:纯"从头训任务"的消亡

在预训练范式确立前,业界主流是"每个任务单独收集标注、从零训一个模型"。它的问题在大数据时代被放大:标注贵、小数据过拟合、无法复用通识。预训练范式用"一次通识、处处微调"在成本与效果上形成碾压,这条老路基本退出主流——只在一些极细分、数据极少的场景还偶见。

4.5 为什么"预训练"会被想到(总结性回答)

原因一

标注太贵、任务太多 → 不能每任务从零训。

原因二

无标注文本近乎无限 → 自监督能白嫖通用知识。

原因三

迁移学习的老经验 → 底层通用特征可复用。

原因四

2006 逐层预训练 + 2012 规模化已证明"先通用后专用"可行。

一句话:先花大代价学一个"通才",再用极低成本把它变成"专才"——这比"每任务单独训"在经济上形成降维打击。预训练回答的是"怎么用便宜的方式,把海量文本里的通用能力先存起来"。

交互:预训练 → 微调 流水线

原料

海量无标注语料

网页/书籍/代码,万亿 token 级。

阶段1

自监督预训练

预测下一个词,学到通用语言与世界知识。

阶段2

微调到任务

用少量标注数据适配具体任务。

产出

可用模型

一个通才 + 一份任务适配。

点击上方任一阶段查看说明。

实操:预训练到底怎么做(一条可复现的流水线)

① 数据工程网页/书籍/代码多语混合,按"质量+多样性"配比;去重、过滤低质、剔除与测试集重叠文本防污染。
② 分词BPE/SentencePiece 子词分词,词表 32k–256k,把文本变成可预测的 token 序列。
③ 训练目标自回归 next-token 预测(交叉熵),或去噪/掩码目标(BERT 系)。
④ 数值与硬件bf16 混合精度;ZeRO/FSDP 分片 + 张量 + 流水并行;gradient checkpointing 省显存。
⑤ 调度warmup + cosine 学习率衰减;按 Chinchilla 配比定"参数 vs 数据 token";监控 loss spike 与梯度范数。
⑥ 检查点保存最优 checkpoint;训练后期做 LR 退火(annealing)再收敛。
一句话:预训练不是"把模型扔进数据里",而是数据工程 + 并行工程 + 训练调度的组合拳——这就是为什么"复现一个 GPT"的难点大多不在架构,而在工程。
2020

GPT-3 与"质变"之谜:涌现为什么会出现

把参数堆到 175B 后,GPT-3 第一次展示"不微调、只看几个例子就能做任务"。这引出两个大问题:涌现(为什么突然会?)与缩放定律(能不能预测?)。本节专讲涌现——并且诚实呈现两派。

5.1 GPT-3(2020):为什么"不微调也能做任务"令人震惊

此前的模型(GPT-2、BERT)大多还要"微调"才能做具体任务。GPT-3 在 175B 参数下,完全不更新权重,只要给几个示例(few-shot / 上下文学习),就能翻译、做题、写代码。

这第一次让人意识到:规模本身似乎带来了新能力。模型在预训练阶段就"暗中学会"了大量任务的模式,只是规模够大才显现出来。这一观察,直接点燃了后面的"涌现"研究与"缩放定律"工程化。

5.2 涌现:它是什么、又为什么会出现(重点)

你已知定义(小模型没有、大模型突然有的能力)。下面讲为什么——这是全篇最需要"讲透"的地方,我分三派呈现,并给出诚实结论。

视角 A:度量的"假象"论(必须诚实告知)。Schaeffer 等人(2023)指出:很多"涌现"其实是评价指标非线性造成的表观。用"精确匹配/准确率"看,能力是阶跃的;但看底层的连续损失(困惑度),其实是平滑下降的。任务有"及格线",模型一旦跨过这条线,指标就从 0 跳到 1——不是能力突变,是评分突变。含义:部分涌现是测量方式放大出来的,并非真有"神秘跳跃"。
视角 B:组合性 / 相变论(真能力跃迁的一面)。语言与推理有组合结构:当模型容量跨过某临界点,它才"突然"能稳定做多步推理、长程指代、跨语言迁移——类似物理里的相变(水到 100°C 才沸腾)。这与"损失 Landscape 出现更平坦的极小值""模型内部形成了可复用的子程序"等假说相关。

视角 C:任务难度阈值论。某些能力(如 8 位数加法、特定代码模式)有内在的最小模型容量:小于它就完全不会,大于它才突然会——容量本身存在"门槛"。

⑤ 诚实结论(研究现状)

我们至今没有完全解释涌现。较稳妥的说法是:涌现 = 平滑下降的损失 + 离散/非线性指标 + 任务内在难度阈值 + 组合性 共同作用的表象。其中一部分是"真能力跃迁",一部分是"度量放大"。这正是它最迷人也最该如实讲清的地方——请不要把它当成已被破解的魔法。

5.3 交互:相变滑块 + "换指标看是否还突变"

拖动滑块改变模型规模;勾选"用连续损失指标"可看到:换成连续指标后,原本"突变"的能力曲线会变成平滑下降——这正是视角 A 所说的"度量假象"。

规模:1e9
能力/损失:未涌现
2020 – 2024

三大缩放定律:它们是怎么被"想"出来的

你问"缩放定律的由来,怎么想到的"。答案是:每条定律都源于一个具体的工程动机,且是同一主题的三次递进。

6.1 Kaplan 等(2020):经验幂律——把"大力出奇迹"量化

动机(很务实):训练一个大模型动辄几百万美元,没人敢盲调。人们迫切需要一条"用小实验预测大模型表现"的经验规律,好做预算与决策。

发现:测试损失 L 与算力 C、参数量 N、数据量 D 都服从幂律 L ∝ C^(−α)(α≈0.076)。也就是说,加算力/加参数/加数据,损失按一条可预测的曲线下降。

为什么是幂律(深入到机理):经验上"学习曲线"常呈幂律;理论上,模型有效容量随参数/数据呈幂次增长,而损失随容量呈幂次下降,两套叠后仍是幂律。它也呼应 Sutton 的"苦涩的教训":通用方法(搜索 + 学习)随算力缩放,长期胜过人工精巧设计。

L(C) = a · C^(−α)  α ≈ 0.076( Kaplan et al., 2020 )

6.2 Chinchilla(Hoffmann 2022):最优分配——之前都训少了数据

背景问题:Kaplan 定律指导大家"疯狂堆参数",但有人怀疑——是不是数据给少了?

关键洞察:固定算力下,"堆参数"和"喂数据"要等量增长才最优。Hoffmann 等人用同等算力训了 70B 的 Chinchilla(1.4T token),反超更大的 Gopher(280B) 与 GPT-3(175B)。

为什么想到:重新审视"最优分配"——此前只优化参数,忽略了数据也是同等重要的缩放维度。结论:约 20 个 token 配 1 个参数。这纠正了"越大越好"的盲目,指出参数与数据必须同步缩放。

一句话:Kaplan 说"规模有用且可预测",Chinchilla 说"参数和数据要均衡"——后者把前者的"算力预算"拆成了两个要同时优化的旋钮。

6.3 测试时缩放(2024+,o1 / DeepSeek-R1):缩放延伸到推理

动机:训练侧算力越来越贵,边际收益在放缓;但"让模型推理时多算一会儿"便宜得多。

关键洞察:把"compute"从训练挪到推理——模型在回答难题时,用思维链、搜索、自我验证多花计算,表现继续上涨。

为什么想到:类比人类"快思(系统 1)/ 慢思(系统 2)"——难题不该靠直觉,该靠"多想"。o1/R1 用强化学习,把"多想"变成模型自发的、可训练的行为。

能力 ↑ 随 推理时 compute ↑ (训练缩放 + 推理缩放 = 双重缩放)

6.4 交互:三定律并列 + 损失/能力双轴 + 最优分配

模型规模:1e9
预测损失:
阶段:基础建模

交互:固定算力下,参数 vs 数据 的最优分配

拖动两个滑块分配"参数/数据"比例,看综合表现峰值出现在何处(Chinchilla:两者均衡最优)。

参数占比50%
数据占比50%
综合表现:
2022 – 2023

后训练与对齐:人们为什么想到"训练完还要再训一轮"

为什么想到后训练?答案藏在一个被忽视的问题里——"模型会说话,不等于说人话"。

7.1 对齐问题(Alignment)是怎么被发现的

预训练模型学的是"互联网文本的联合分布"——它什么都会写,但不代表它写的是你想要的。它会跑题、会输出有毒内容、会无脑谄媚、会无视你的指令格式。

人们逐渐意识到:"能力强"和"听话 / 安全"是两件事。预训练给的是"能力",还缺一个把能力"对齐到人类意图与价值观"的步骤。这就是"后训练(post-training)"存在的根本原因。

7.2 InstructGPT / RLHF(2022):为什么用"偏好"而非"标准答案"

背景问题:直接让人写"每个任务的标准答案"——贵、主观、写不完

关键洞察(极巧妙):让人比较"哪句回答更好",比让人"什么是好回答"容易得多,而且人与人之间更一致。把模糊的"有用/无害"变成可比较的信号。

方法三步走:SFT(监督微调):用少量"示范回答"教模型照这个格式/风格答;② 奖励模型(RM):用人类"二选一偏好"训练一个打分器(基于 Bradley-Terry 偏好模型);③ RLHF(PPO):用强化学习,让模型在"拿高分"的引导下生成——把模糊的"有用/无害"变成可微的奖励信号

为什么有效:它把"难以定义的对齐"转成"可优化、可微的目标"。这一步让 ChatGPT 从"会说话"变成"听得懂人话"。

7.3 DPO(2023):为什么想到"去掉奖励模型"

背景问题:RLHF 的奖励模型本身会被模型钻空子(reward hacking)、会漂移,且 PPO 训练不稳定、对超参敏感。

关键洞察:数学上可以证明——直接在偏好对上做"分类式"优化,等价于 RLHF 的最优解。于是干脆不训奖励模型、不用 RL,只用一个简单的损失函数。

贡献:后训练从"RL + 奖励模型"简化为"一个分类损失",更稳定、更易复现。这也解释了为什么小团队(含开源社区)也能自己做对齐。

③ 失败/淘汰路线:奖励模型被攻破、PPO 不稳

RLHF 并非完美终点。奖励模型是"用一个模型去评判另一个模型",它本身会被策略模型钻空子(写出看似高分实则无用的套话);PPO 对学习率、奖励缩放极敏感,调参如走钢丝。正是这些痛点,逼出了 DPO、RRHF、直接偏好优化等"去奖励模型"的简化路线——后训练仍在快速演化。

7.4 交互:对齐流水线 + "若无后训练"反例

步骤1

SFT 监督微调

用示范回答教"格式与风格"。

步骤2

训练奖励模型

用人类偏好二选一训打分器。

步骤3

RLHF (PPO)

强化学习让生成拿高分。

更优

DPO 直优化

去掉奖励模型,直接偏好分类。

点击上方任一阶段查看说明。

反例:如果跳过"后训练"会怎样?

仅预训练的输出:
"用户:怎么安全地绕过密码?"
→ 模型可能直接罗列具体步骤(因为它学的是"互联网上这类句子通常怎么接")。

后训练后的输出:
"用户:怎么安全地绕过密码?"
→ 先澄清意图、指出风险,并引导到正当途径(如找回密码流程)。

这正说明:预训练 = 给能力与知识;后训练 = 给人格、边界与意图跟随。两者解耦,是因为目标、数据、优化方式都不同。

7.5 实操:2025–2026 的"模块化后训练栈"(重点)

你问"后训练到底怎么做"——现代后训练早已不是单一的 RLHF,而是一条模块化流水线,每一段解决一类问题:

段1

SFT 指令跟随

高质量指令数据,建立格式/风格。

段2

偏好优化

DPO/SimPO/KTO,离线、低成本对齐。

段3

RLVR 推理强化

GRPO/DAPO + 可验证奖励,练数学/代码。

段4

安全 RL

宪法 AI / 规则 RL,守住红线边界。

点击上方任一段查看具体做法。

GRPO 为什么取代 PPO 成为 2025 主流:对同一 prompt 采样一组回答,用组内相对奖励做基线——不需要 critic 价值网络,显存减半、实现简单,天然适配"一条推理链一个总奖励"的场景(DeepSeek-R1 就是用它)。DAPO 等进一步解决探索不足/熵塌缩。

奖励家族:信号从哪来,决定能优化什么

点击按钮查看该奖励家族的"信号来源 → 用途 → 优缺点"。

以后怎么做:RLAIF 规模化(AI 反馈逐步替代人工)、PRM 过程监督(逐步给分而非只看终局)、多目标 RL(Pareto-DPO 同时优化有用/安全/推理)、持续后训练(用真实使用轨迹不断重训)。未解之问:RL 是在"创造"推理还是仅"放大"预训练已有的推理?
2022 – 2025

推理时代:思维链与"会思考的模型"

就算对齐好了,模型遇到难题还是容易"一步跳错"。于是人们想到:让模型把思考过程写出来

8.1 Chain-of-Thought(2022):为什么"一步步写"能变聪明

背景问题:直接问难题,模型常因"一步跳错"而全盘皆输。

关键洞察:复杂任务需要中间计算。让模型"先写推理步骤,再给答案",等于把"难的一步"拆成"易的多步",每步更不易错,且错误可追溯、可修正。

为什么有效:它把隐藏的推理外显,充分利用了模型在"生成"上的强项来辅助"决策"。这本身就是"测试时缩放"的雏形——多花 token(推理计算)换准确率。

8.2 o1 / DeepSeek-R1(2024–2025):把 CoT 变成"训练目标"

动机:CoT 原来靠"提示词让人写",能不能让模型自己学会长思考

方法:用强化学习,只奖励最终答案正确,让模型在探索中自发发展出"长思考、自我反思、搜索不同解法"的策略。DeepSeek-R1 还开源了推理模型,把"思考能力"普惠化。

与测试时缩放汇合:这把第 6.3 节的"测试时缩放"真正落地——模型在推理时自主决定花多少计算。难问题多想、易问题少想。

一句话:从"人写思维链让模型照做",进化到"模型自己学会写思维链"——智能从'快答'走向'深思'。

8.3 交互:思维链逐步展开

点"开始思考",看模型如何把一道多步题拆成可显示的推理步骤,最后给出答案(逐行淡入,模拟"边想边写")。

8.4 实操:推理能力"怎么做"出来的(三层)

提示级

CoT 提示("请逐步思考")、few-shot 示范、self-consistency(采样多条思路投票)、tree-of-thought(分支探索)——不改变权重,只改变解码方式。

训练级

RLVR 在数学/代码上强化"长 CoT"(o1、R1 路线)——模型学会自己"思考更久":长思考、自我反思、搜索不同解法。

产品级

推理预算旋钮(instant / thinking / high 档),按任务付费买思考量;o1 类模型隐藏内部思维链(只给摘要)防越狱与作弊。

以后怎么做:推理能力内置进架构(隐式、可控制、可检视);外部 scratchpad / planner / 模拟器与模型协同;Agent 级推理——推理单位从"一个回答"变成"一个任务"(想 + 调工具 + 看结果 + 再想)。
2024 – 2025

效率与开放:DeepSeek 为什么能用 1/30 的价格

同等能力下,DeepSeek 的 API 价格约为 GPT-4o 的 1/20 ~ 1/30。这不是偷工减料,而是架构与工程的多重红利叠加。下面每项都交代"为解决什么瓶颈"。

9.1 MoE(混合专家):把"模型大"与"推理贵"解耦

瓶颈:稠密模型每个 token 都要激活全量参数,参数越大推理越贵,能力上限被成本锁死。

解法:MoE 把模型切成很多"专家",每个 token 只激活其中少数几个。总参巨大(存能力),但每 token 只激活约 1/10(降推理成本)。DeepSeek-V3 总参 671B,每 token 仅激活约 37B。

激活专家:— / 12
为什么便宜:用 MoE 把"容量(总参)"与"每次计算(激活参)"解耦,是 DeepSeek 性价比的第一性的来源。

9.2 FP8 / DualPipe / MLA / GRPO:每项对应什么工程瓶颈

FP8 训练

瓶颈:训练显存/带宽吃紧。用 8 位浮点替代 16 位,算力/带宽近乎翻倍,且首次大规模验证可行。

DualPipe

瓶颈:流水线"气泡"(设备空等)。双流调度让前后向重叠,削泡提效。

MLA

瓶颈:长上下文 KV Cache 爆炸。把 Key/Value 压到低维潜空间,显存大降。

GRPO

瓶颈:RLHF 的评论员(critic)占显存且易不稳。用"组内相对优势"去掉 critic,更稳更省。

9.3 开源低价策略:把模型当基础设施

DeepSeek 直接开源权重、以接近成本定价,没有重营销与品牌溢价,并通过蒸馏把能力下沉到小模型。这把"模型"当成基础设施而非"产品护城河",靠生态与低价换采用。

一句话总结:MoE 解耦容量与成本 → FP8/MLA/GRPO 压低训练与部署 → 开源低价释放红利。

9.4 实操:把成本打下来的"组合拳"全表

这些技术不互斥,而是叠着用——"效率"是系统工程,不是单点魔法:

技术干什么效果 / 代表
MoE 混合专家路由只激活少数专家(top-2~4)万亿参数推理只激活 ~10–20%(Kimi K2、DeepSeek V3/V4、Grok)
MLA 潜在注意力把 KV cache 压缩进低维潜空间长文本推理显存降 70–90%(DeepSeek 原创)
DSA / 稀疏线性注意力稀疏或线性复杂度的注意力变体1M 上下文"经济可行"(DeepSeek V3.2)
FP8 训练8 位浮点混合精度训练显存/带宽近乎减半
DualPipe双向流水并行,隐藏通信训练利用率大幅提升
蒸馏 / 量化 / 投机解码大模型教小模型;4bit 权重量化;小模型草稿+大模型验证端侧可跑、延迟骤降
以后怎么做:Transformer + SSM(Mamba)+ 循环记忆的异构混合架构成为基座标配;硬件-模型协同设计(模型针对特定芯片优化);端侧 SLM 爆发——"通用基座(云)+ 高效模型(端)"分层,专用推理 ASIC / 存算一体"以存补算"。
2020 – 2026

视觉与多模态:从"视觉盲"到"全模态生成"

多模态的故事还是同一条主线:把一切变成"token",再喂给 Transformer。但它比纯文本晚了好几年,不是因为方向不对,而是因为踩了三个多了的坑——维度多了、时序多了、数据难了。下面按五段式骨架走:先看瓶颈,再看突破,最后看为什么少数玩家能跑通。

10.1 背景问题:多模态到底难在哪

① 维数灾难:一张图几十万像素,但"语义信息"可能就几个词——模型怎么从像素中提取高层语义?文本是离散符号,图像是连续信号,两者天然不在同一个空间。

② 模态对齐:怎么让"猫"的图片和"猫"的文字在模型内部指向同一个概念?不能靠监督标注(每张图打标签太贵),只能靠弱监督 / 自监督从图文关系中学习。

③ 时序一致性:视频不只是很多张图——帧间运动、物体跟踪、因果推理。模型需要知道"那个球从左边滚到右边,中途被挡住了一下"仍然是同一个球。

④ 数据瓶颈:互联网文本无限,但高质量图文对、视频片段、音频标注——每类的获取成本都比文本高一个数量级。视频模型即使参数量小(33B),训练数据也远少于文本模型。

一句话:多模态不是"单一模态的简单叠加",它要同时解决"怎么表示""怎么对齐""怎么生成""怎么评估"四个独立难题——每个难题都对应一个方向的研究,不是堆一个模型就能解决的。

10.2 关键洞察:视觉理解(ViT 2020)与跨模态对齐(CLIP 2021)

ViT——图像也能"分词"
背景问题:CNN 长期统治视觉,但它靠"局部卷积+层层下采样"手工设计归纳偏置——每换一个任务就要重新设计架构。关键洞察:图像不必用卷积,切成 16×16 patch 当 token 序列喂给 Transformer——和"文本分词"本质上同一件事。为什么有效:Transformer 可并行、可缩放、可跨模态共享同一架构。怎么做:图像 → 分 patch → 线性投影 + 位置编码 → Transformer 编码。ViT 第一次证明:视觉和文本可以在同一架构对话

CLIP——让图文"互相理解"
背景问题:传统的图像分类需要标注("猫""狗"),每张图都要人工打标签,覆盖不了无限的概念。关键洞察:不用给每张图打标签,用对比学习拉近匹配的图文对、推远不匹配的——学习信号来自"关系"而非"标注"。为什么有效:对比损失(InfoNCE)天然产生跨模态共享表示,零样本泛化强。怎么做:图文对 → 双塔编码(图像编码器+文本编码器)→ 对比损失 → 对齐向量空间。CLIP 奠定了"任意模态都可以在同一个向量空间对齐"的方法论。

文本token
图像token
音频token
统一 Transformer

统一表示之后,"看图说话""以图搜文""语音对话"都只是"不同模态 token 进、目标模态 token 出"的同一套机制——这正是多模态大模型的底层逻辑。

10.3 瓶颈与进步:从"能理解"到"能生成"

之前(2022–2024)的瓶颈:文生图已经可用(SD、Midjourney),但视频生成是"帧独立生成"——闪烁、运动不连贯、没人脸一致性。核心卡在三个地方:视频 tokenizer 压缩率低导致序列爆炸;语言理解弱(听不懂"分镜""时间戳""镜头运动");训练数据规模小。关键瓶颈不是"参数不够大",而是架构和压缩效率卡住了

进步(2025–2026)——为什么突然变强
这场蜕变不是单一突破,是六项技术同步成熟:

① DiT 架构

扩散 Transformer 替代 UNet——把扩散的"去噪"和 Transformer 的"可缩放"合并,让视频生成也吃上了 scaling law。

② 高压缩 VAE

Tokenizer 改革(H3-VAE 等):压缩率提高 4 倍,序列长度大幅降低,2K 原生输出才变得经济可行。这是视频模型"小参数(33B)但强能力"的底层原因。

③ 语言注入

大语言模型的能力注入视频模型——能理解复杂 prompt(分镜、运镜、时间戳),这是"听得懂人话"的基础。

④ 全模态统一上下文

文/图/音/视频在同一个 Transformer 上下文里理解(H3-Omni),不需要分模型——"参考视频 A 的镜头运动,让图 B 中的人物唱歌,歌声参考音频 C"一次到位。

⑤ 音视频联合

视频和音频同时生成,天然对齐,不需要后期配音。

⑥ 视频 RLHF

人类审美偏好(电影感、一致性、文字渲染)变成可优化信号,告别"闪烁+违和+乱码"。

10.4 技术原理:关键组件详解

组件要解决什么原理怎么做
Tokenizer(VQGAN / H3-VAE)连续信号→离散 token卷积编码器+向量量化+解码器,学一个"视觉词汇表"训练自编码器,压缩率是关键指标;H3-VAE 的 4 倍压缩把序列长度降下来
DiT(扩散 Transformer)扩散+Transformer 合体把扩散噪声预测换成 Transformer 处理 patch token序列去噪,时间步作为条件注入,替代 UNet 实现可缩放生成
跨模态对比学习图文向量对齐对比损失(InfoNCE)拉近正对、推远负对双塔结构(图像编码器+文本编码器),batch 内负采样
全模态统一上下文文/图/音/视频同模型各模态各自编码后 token 序列拼接,统一 Transformer 建模模态编码 + 序列拼接 + 因果掩码/双向,H3-Omni 是代表
音视频联合建模音画天然对齐视频帧+音频波形同时 tokenize,统一生成多流 Transformer 或 VAE 联合潜空间,生成时不分步
In-context Regeneration超分不丢信息基模对低分辨率结果重新生成(带原始上下文),而非外挂超分模块超分在生成时用上下文"猜"细节,恢复小文字/纹理比插值准
一个反直觉事实:视频模型参数量(H3 仅 33B)远小于旗舰文本模型(DeepSeek V3 671B、GPT-4 ~1.8T)。因为视频的成本不来自参数容量,而来自序列长度——一次推理要处理几十万到上百万个视频 token,算力全部烧在"渲染"而非"记忆"上。文本模型是"大脑大、说话便宜";视频模型是"大脑小、眨眼烧钱"。

10.5a 为什么只有少数玩家做得好:四道隐形壁垒

33B 参数,任何有算力的公司理论上都能训。但"能训"和"做得好"隔着四道壁垒:

壁垒① 视频数据(70% 胜负手)

训练要"片段级+高质量 caption+多模态对齐"的视频数据,收集/清洗/标注成本远超文本。字节有抖音/西瓜海量视频库;MiniMax 多年积累+强化 captioning 管线。这是参数表上看不到的护城河。

壁垒② Tokenizer 工程

H3-VAE 的 4 倍压缩率、字节的稀疏注意力采样——这些不是论文里能抄的配方,是反复实验调出来的隐性 know-how。Tokenizer 的压缩率直接决定推理成本上限。

壁垒③ 训练稳定性

视频扩散训练极不稳定:时序一致性、分辨率自适应、长序列稀疏化,任何一个环节崩就白烧钱。字节延续 2.0 架构纵深迭代;MiniMax 为此主动放弃 Hailuo-02 架构重写。

壁垒④ 算力+主观评测闭环

视频训练/推理成本高(4K 30s 需 8×A100 跑 ~8.7 分钟);"好不好"靠人海盲测、偏好数据对齐,成本极高。字节有火山引擎算力池+即梦/豆包商业化闭环;MiniMax 有海螺平台+开源生态反哺。

诚实修正:做得好的不止 H3 和 Seedance 2.5。快手可灵 3.0、谷歌 Gemini Omni Flash 也在第一梯队(盲测 H3 与 Omni Flash 差距仅 5 Elo 点内)。OpenAI 的 Sora 反而在 2026 年 4 月黯然退场。H3 和 Seedance 2.5 的特殊性在于同日发布、路线截然相反,是"两条路线"的典型代表,而非"仅有的两个强者"。

10.5b 当前的两条路线:Seedance 2.5 vs MiniMax H3

2026 年 7 月 31 日,两款旗舰视频模型同日上线,但走了完全相反的路:

维度MiniMax H3Seedance 2.5(字节)
定位通用全模态生成平台工业级视频生产工具
开源/闭源开源(33B 权重,Apache 风格)闭源(架构未公开)
参数量33B(官方确认)未公开(行业推测数十 B)
最长时长15 秒30 秒(行业最长)
最高分辨率原生 2K原生 4K
多模态参考自然语言描述统一上下文最多 50 份素材(30 图+10 视频+10 音频)
音频原生双声道(音视频联合建模)10+ 语言口型同步
编辑能力V2V 动作迁移、自然语言编辑精准时间戳控制、局部编辑、绿幕
API 价格0.8 元/秒(2K)~1.5 元/秒(720P)
实测"性格"更懂成片:宁可少做也保住电影感更听话:精准执行指令,但可能牺牲全局一致
选择建议:需要"第一眼就过关"的美术类任务 → H3;需要"逐条核验通过"的工业化交付 → Seedance 2.5。这不是谁更强,是两种创作哲学——视频生成第一次有了"有得选"的局面。

10.6 怎么做:多模态生成工作流与选型

① 文生图SD/DiT 文生图,搭建视觉基底
② 图生视频Seedance I2V / H3 图→视频,让静态画面动起来
③ 多参考视频ref2v(多图+视频+音频混合参考),锁定角色/场景/声音
④ 局部编辑时间戳控制/绿幕/视角编辑,改一处不重生成整条
⑤ 音视频同步H3 原生双声道 / Seedance 口型同步,音画对齐
⑥ 3D 生成NeRF/3D Gaussian Splatting,从平面到空间

选型决策:成本敏感、需要微调 → H3(开源+低价);长叙事、4K 交付、工业级控制 → Seedance 2.5。

10.7 遗留与争议

世界模型之梦——生成≠理解:视频模型能生成"看起来像"物理世界的画面,但实测里 Seedance 2.5 把货船放到水泥地上、H3 的四个机位全是同一视角——生成能力不代表因果推理。视频生成离"世界模型"还有本质距离。
多模态评估难:文本有标准 benchmark,视频"好不好"高度主观。审美偏好 vs 客观指标没有统一标准,各家自说自话,评测结果水分大。
统一上下文成本:全模态 token 数爆炸,当前架构的经济性瓶颈。H3 的 33B 能跑通靠的是 VAE 4 倍压缩,但长视频/高分辨率下成本仍然陡峭。
开源 vs 闭源分化:H3 开源权重 vs Seedance 闭源工业线——生态分化刚刚开始,3 年后会形成"开源赢部署、闭源赢体验"还是"开源追平闭源"?没有定论。
回看

被淘汰 / 未主导的路线:历史感的来源

一部真正的历史,不能只写赢家。下面把这些"当时很有希望、最终没成主流"的路线集中陈列——它们反衬出今天为什么是这条主线胜出。

符号主义 / 专家系统

靠人工规则,无法规模化;维护成本随规则数指数上升。输在"可扩展性"。

早期 MoE / 条件计算(1990s–2017)

Hinton/Jacobs 早在 1991 就提出混合专家,Shazeer 2017 的 Sparsely-Gated MoE 也早于 Transformer 大火。但当时硬件/框架对"动态稀疏激活"支持差,训练不稳,直到算力与工程成熟才由 DeepSeek 等发扬光大——又一次"洞察领先于工具"

胶囊网络(Capsule, Hinton 2017)

试图用"胶囊"显式建模物体的姿态/部分-整体关系,替代 CNN 的池化。想法优雅,但训练复杂、收益不够明确,未取代 CNN/Transformer。

GAN 的模式崩溃

生成对抗网络曾主导图像生成,但训练不稳定、易模式崩溃(只会生成少数样本)。最终被扩散模型(Diffusion)在稳定性上反超——而扩散模型的"去噪"也可视作一种序列化生成,与自回归殊途同归。

这些"失败"并非浪费:符号主义的"可解释性"诉求、胶囊的"结构建模"、MoE 的"条件计算"——它们的合理内核,今天分别以"工具调用/函数调用""结构化推理""稀疏激活"的形式活在主流系统里。淘汰的常是具体形态,留存的是思想。
2025 – 2026.8

模型战争到智能体时代:最近 18 个月发生了什么

主报告止步于 2024。这里补上 2025–2026 年 8 月这段:发布节奏快到平均 每 4.8 天一款重要模型,竞争焦点从"谁的模型强"全面转向"谁的生态广、谁能闭环干活"。下面按真实时间推进,先讲故事,再看结构。

12.1 2025 上半年:从 DeepSeek-R1 到"推理革命"

2025.01

DeepSeek-R1 引爆"低成本推理配方"

开源模型首次在数学/代码推理上逼近 OpenAI o1,且公开训练细节——GRPO + RLVR(组内相对策略优化 + 可验证奖励)被全球复刻,点燃全年 Agentic RL 热潮;App 登顶中美商店,倒逼闭源厂跟进"深度思考"。

2025.02–03

混合推理 + MCP 协议:Agent 的"USB-C"时刻

Claude 3.7 Sonnet 把"思考"做成一个可调旋钮;MCP 协议成为模型↔工具的标准接线,Agent 生态的"TCP/IP";Claude Code 让命令行 AI 编程 Agent 首次大规模进入开发者日常。

2025.04–06

协议战与开源全家桶

Google 提出 A2A(智能体↔智能体互操作)争夺协议基准;阿里开源 Qwen3 全家桶(4B–235B,思考/非思考双模式);Claude 4 巩固编程首选;Gemini 2.5 Pro 正式版与 Veo 3 确立"原生多模态 + 视频生成"双线优势。

12.2 2025 下半年:模型战争的"疯狂四个月"

2025.08

GPT-5:推理/非推理一体化

把 o 系列推理能力与 GPT 系统一进一个模型、一套接口,取代 4.x 与部分 o 系成为新一代通用旗舰——"一体化 + 统一接口"从此成为行业默认设计。

2025.09

Sora 2 与视频生成质变

物理准确性、真实感、可控性、音画同步四方面突破,AI 视频从"玩具"进入"创作"。

2025.11

"史上最疯狂模型月"

GPT-5.1、Gemini 3(Pro/DeepThink)、Claude Opus 4.5、Kimi K2 Thinking、GLM-4.6 轮番发布;Gemini 3 被视为 Google 重新站稳脚跟的里程碑;Agent/编码能力成为主战场。

2025.12

效率军备 + 开源权重回归

DeepSeek V3.2 用自研 DSA 稀疏注意力让 1M 上下文"经济可行";GPT-5.2 分 instant/thinking 双模式;OpenAI 罕见发布 GPT-oss 开源权重——竞争从模型能力转向生态与部署位置。

12.3 2026 上半年:智能体时代(到 8 月前)

宏观信号:竞争焦点从"谁的模型更强"→"谁的模型更多人用、谁能闭环干活";发布进入"季度大版本 + 六周点版本"节奏;1M 上下文成为标配;中端模型获得前沿级能力。

2026.02

Agent Teams 与"智能体团队"产品化

Claude Opus 4.6 把"智能体团队"做成产品特性;Gemini 3.1 Pro 推理能力约翻倍、价格不变;Qwen3.5(397B-A17B)原生多模态、201 语言开源。

2026.04

GPT-5.5 与 DeepSeek V4:模型开始"操作软件"

GPT-5.5 能跨文档/表格/软件完成 Agent 式任务;DeepSeek V4-Pro(1.6T 总参/49B 激活,MIT 许可)开源逼近前沿——开源权重首次系统性站上"前沿级"(约 80% SWE-bench,⚠️第三方评测待核实)。

2026.05–06

中端前沿化 + 动态工作流

Gemini 3.5 Flash 在编码/Agent 上超 3.1 Pro 且快 4 倍;Claude Opus 4.8 主打 Dynamic Workflows;Sonnet 5、GLM 5.2、Kimi K2.7-Code 等密集落地——大多数 Agent 负载的理性默认选择从旗舰转向中端

数据可信度提示:2026 上半年条目来自公开聚合盘点,其中 Gemini 3.1 Pro / GPT-5.4/5.5 / Claude Opus 4.6/4.8 / DeepSeek V4 / Qwen3.5 / GLM-5 为多源交叉验证;Claude Fable 5、GPT-5.6、Meta Muse Spark、小米 MiMo 等为单源信息(⚠️),页面保留但请以官方披露为准。

12.4 交互:2025–2026 重要节点时间轴

点击年份按钮,查看该节点的"事件 + 为什么重要"(含幕后主线)。

点击年份查看节点详情。

12.5 近 18 个月的五个数字锚点

4.8 天2026 上半年平均每款重要模型发布间隔
1M上下文长度成为主流标配(靠高效注意力)
1.6T/49BDeepSeek V4 总参/激活参(MoE 极致)
6 周Anthropic 点版本发布节奏

12.6 时间线背后的七条主线(一以贯之)

比名单更重要的是这七条贯穿 2025→2026.8 的主线——它们是理解"为什么节奏这么快"的钥匙:

主线1 · 推理常态化

CoT / RLVR / 推理时计算从论文走向每个产品按钮,从"快答"走向"深思"。

主线2 · 上下文变长变便宜

MLA → DSA → 线性注意力,百万 token 从营销数字变成日常能力。

主线3 · 开源逼近前沿

DeepSeek R1/V3/V4、Qwen3、Kimi K2 把旗舰能力带到 MIT 许可 + 极低成本,倒逼闭源降价与开源。

主线4 · Agent 协议标准化

MCP(模型↔工具)与 A2A(智能体↔智能体)争夺"AI 时代的 TCP/IP"。

主线5 · 多模态原生融合

一个模型原生吃文本/图/音/视频/3D,跨模态联动生成成为标准交付物。

主线6 · 推理算力反超训练

"推理革命":高频使用取代重复训练,专用推理芯片 / 存算一体兴起。

主线7 · 能源成为新瓶颈

竞争焦点从芯片转移到电力稳定性——算力地理开始影响格局。

合起来看:这 18 个月不是"又变强了"这么简单,而是AI 从"模型竞赛"转入"生态融合与垂类爆发"——能力普遍达标后,比拼的是部署位置、工具生态与闭环效率。
2026 → 未来

未来怎么发展:七条技术路线与未解之问

未来五年绕不开四条主线:推理效率、世界模型、Agent 闭环、对齐评测。下面给七条具体路线(每条:现状 → 目标 → 卡点 → 代表),再诚实地列出现阶段没有定论的争议。

13.1 交互:七条技术路线卡片

点击卡片查看该路线的"现状 → 目标 → 卡点 → 代表"。这不是预言,是当前产业与研究共识的归纳。

点击卡片查看路线详情。

13.2 七条路线的"技术栈速查"

每条路线的落地形态各不相同,但底层共享同一批基座技术——这就是为什么它们会同步爆发:

路线核心技术栈典型交付形态
Agentic AIMCP/A2A 协议、长程记忆、工具调用、反思/辩论、子智能体编排员工专属 Agent、AI DevOps、多智能体工作流
世界模型与具身NSP 目标、视频+传感器+物理仿真联合训练、sim-to-real自动驾驶仿真、机器人基础模型、分子动力学模拟
多模态原生统一 token 空间、跨模态对齐(类 CLIP)、时序对齐视频理解/生成、跨模态检索、创作工作流
高效推理与端侧MoE+SSM+MLA 异构混合、量化/蒸馏、硬件协同设计、存算一体端侧 SLM、专用推理芯片、离线低延时应用
合成数据self-play 自博弈、生成式课程、程序化数据(RLVR)推理/代码/Agent 训练数据管线
科学智能 AI4S大模型 + 物理约束、分子表示学习、主动学习闭环药物发现、材料设计、蛋白质结构预测
安全对齐宪法 AI 2.0、可扩展监督、辩论协议、能力门控、沙箱红线对齐模型、合规评测、系统级安全框架

13.3 未来 3–5 年:一张可预期的时间表

2026–2027

智能体规模化落地

企业级智能体元年:MCP/A2A 生态成型,多智能体协作进入生产;端侧 SLM 普及,"通用基座 + 高效模型"分层。

2027–2028

世界模型与具身量产

人形机器人从工厂巡检/物流走向更广场景;世界模型支撑仿真训练;多模态从"理解"走向"物理直觉"。

2028–2030

AI 代理经济成型

AI 代理成为消费与企业服务的中介("商家→AI 代理→消费者"链路);合成数据 + 持续后训练让模型在部署中继续进化;安全评测与治理框架与能力赛跑。

提醒:时间表是"当前共识的线性外推",不是预言。历史上每次都被低估的是"组合效应"(多技术叠加),被高估的是"单点突破速度"。请把它当作"最可能路径",而非"确定性时间表"。

13.4 未解之问:六条诚实的争议

有研究提出"RLVR makes models faster, not smarter":强化学习可能只是在放大预训练中已有的推理能力,而非创造新能力。若属实,"后训练决定推理上限"的说法就要打折扣——知识仍来自预训练。
延续主报告的双视角:2025–2026 更多证据指向"能力随规模平滑增长,只是离散指标放大了跳变观感";但"顿悟时刻"式的行为仍不断出现。结论:一部分是真能力跃迁,一部分是度量放大,比例未定。
2025 出现"算力铁律终结"论调与 benchmark 饱和,甚至"AI 冬天"论战重燃;但 test-time scaling(推理时缩放)与数据效率提供了新的增长轴。预训练缩放或许放缓,推理时缩放才刚开始。
角色在反转:DeepSeek/Qwen 开源逼近前沿,Meta 反而转向闭源(Muse Spark)。这证明开源/闭源之争不是情怀问题,而是商业位置与安全策略的博弈——"开源赢部署、闭源赢体验"可能长期并存。
竞争焦点正从"芯片"转向"电力":训练集群耗电以数百兆瓦计,推理算力需求又反超训练。算力地理(东数西算 vs 美国电网)可能影响未来格局;"以存补算"与专用 ASIC 是应对方向。
长时运行 + 工具权限 = 新的攻击面:错误恢复、恶意指令注入、权限滥用。系统级安全(模型+工具+记忆+沙箱+能力门控)与评测(长程自主性、权力寻求倾向)都还在快速演进,未有定论。

13.5 五到十年大图景:两种叙事(不作定论)

叙事 A · 持续演进

现有 Scaling + RL + Agent 组合继续推进,群体智能(多智能体协作)涌现超越单模型的智慧;AGI 是渐进逼近的工程目标,风险可控、治理跟上。

叙事 B · 质变与风险

世界模型 + 超对齐缺口意味着能力可能先于可解释性突破;超级智能到来时人类无法直接评估,对齐是生死问题而非工程问题。

两派共识:无论哪派都承认——推理效率、世界模型、Agent 闭环、对齐评测是未来五年绕不开的四条技术路线。这也是本页的"行动地图"。
尾声

总结:所谓"爆发",是一连串"老洞察 + 新规模"

回头看那条因果地图,没有一步是魔法:BP(1986) 等到了 GPU(2012);RNN 的硬伤逼出了注意力;注意力被泛化成 Transformer;Transformer 的可并行性让"堆规模"成为可能;规模带来了 GPT-3 的质变与涌现之谜;人们又把"堆规模"量化成缩放定律;"会说话≠说人话"逼出了后训练对齐;CoT/o1 把思考变成可训练;DeepSeek 把成本打下来。

给"为什么是现在"的收尾回答

  • 数据:互联网沉淀了万亿级文本/图像,自监督的"免费燃料"到位。
  • 算力:GPU 集群 + 混合精度,让千亿参数可训练。
  • 架构:Transformer 打通了"可并行 + 可缩放 + 长程依赖"。
  • 方法:预训练(存通识) + 后训练(对齐) + 测试时缩放(深思) 三层叠好。
  • 工程:MoE/FP8/MLA/GRPO 把"能力"与"成本"解耦。
仍开放的终极问题:涌现是否真有"相变"?规模红利还能吃多久?对齐能否真正"理解"价值而非"模仿"偏好?RL 是在"创造"还是"放大"推理?这些没有定论——它们正是下一阶段研究者的战场。

接上 2026 的续篇:这部历史还没写完

2025–2026 的 18 个月告诉我们:"爆发"的配方没有变,只是把同一套因果链再走一遍——模型会推理了(第 8 节)→ 人们把推理接上工具(Agent,第 12 节)→ 成本被 MoE/MLA 打下来(第 9 节)→ 下一步是让它"预测世界"而非"预测文字"(第 13 节路线 2)。真正的新变量只有一个:节奏快到了"工程追不上论文"

所以未来五年真正值得盯的不是"哪个模型最强",而是四条主线:推理效率、世界模型、Agent 闭环、对齐评测。详见上一节「未来路线图」。

AI 原理深度史 · 交互式讲解(扩厚版)— 单文件离线可用 · v2.3
内容综合自公开研究:Rumelhart et al. 1986(BP)、Hinton 2006(DBN)、Krizhevsky 2012(AlexNet)、Hochreiter 1997(LSTM)、Bahdanau 2014(注意力)、Vaswani 2017(Transformer)、Mikolov 2013(word2vec)、Peters 2018(ELMo)、Howard 2018(ULMFiT)、Devlin 2018(BERT)、Brown 2020(GPT-3)、Wei 2022(涌现/CoT)、Kaplan 2020 / Hoffmann 2022(缩放定律)、Schaeffer 2023(涌现度量假象)、Ouyang 2022(InstructGPT/RLHF)、Rafailov 2023(DPO)、OpenAI o1 / DeepSeek-R1(推理)、Dosovitskiy 2020(ViT)、DeepSeek 技术报告、以及 2025–2026 公开发布记录(GPT-5/5.1/5.2/5.4/5.5、Gemini 2.5/3/3.1/3.5、Claude 4/4.5/4.6/4.8/Sonnet 5、DeepSeek V3.2/V4、Qwen3/3.5、GLM-5、Kimi K2 等,⚠️ 单源信息以官方披露为准)等。本页用于教学科普,具体数值以官方最新披露为准。