怎么读这份"原理史"
下面不是百科词条,而是一条因果链:后一个突破,几乎都是被前一个的"未解问题"逼出来的。我们按年份推进,每一节统一用五段式拆解。
统一的拆解模板
当时卡在什么具体困难上?
人们想通了什么,才破局?
据此发明了什么机制/算法?
它为什么真的管用?
还留下什么没解决的?
每节都钉在真实年份上。
一张"问题 → 方法"的因果地图
提示:右上角可切换「护眼 / 日间 / 夜间」三套低对比主题;每个交互组件都可点击/拖动。读到最后你会发现——所谓"AI 爆发",不过是一连串"老洞察 + 新规模"的再兑现。
史前与奠基:深度学习的"迟到"
今天所有的"爆发",根子都埋在 1950–2012 这六十多年。这一阶段的主角是连接主义:它很早就有了正确方向,却等了二十六年才等到能跑起来的硬件与数据。
1.1 符号主义与两次寒冬:为什么连接主义后来居上
1956 年达特茅斯会议提出"人工智能"一词,当时主流是符号主义:用人工写好的逻辑规则、if-then 表达式让机器推理。它天然符合人类"思考=操纵符号"的直觉,早期在棋类、定理证明上也有过亮眼表现。
但它卡在一个致命问题上——知识获取瓶颈:真实世界的规则多到写不完,而且规则之间极易冲突。想让机器理解一句话,你几乎要手写完人类全部的常识。这意味着符号系统无法规模化:人写多快,它才多强。
于是 1970 年代、1980 年代两度进入"AI 寒冬"——承诺过高、成效不足,经费断流。这两次寒冬留下一句沉甸甸的教训:没有足够的数据与算力,连接主义(从数据中拟合,而非编程)只是空想。也正因为如此,后来"规模化"会成为一条被反复验证的真理。
1.2 反向传播(1986):一个领先时代 20 年的洞察
要让多层网络从错误里学习,必须知道"每一层的权重该往哪调"。Rumelhart 等人在 1986 年把链式法则系统化,提出反向传播(Backpropagation):先正向算一遍输出,再把误差从输出层一层层往回传,算出每个权重的梯度。
这在数学上解决了"深层网络怎么端到端训练"的根本问题。但讽刺的是——它当时根本跑不起来。原因有三:① 没有大规模标注数据;② 没有 GPU,CPU 算一个中等网络要几天;③ 网络一深就"梯度消失",训出来的效果和浅网络没两样。
1.3 2006 逐层预训练:这是"预训练"思想的远祖
到了 2006 年,Hinton 用深度信念网络(DBN)给出一记重击:深层网络直接端到端硬训会陷入局部最优、梯度消失;那不如先用无标注数据"逐层贪心预训练",让每一层先学一个不错的初值,再整体微调。
这一步的意义,怎么强调都不过分——它等于在 2006 年就承认了一条核心理念:"先学会通用的、底层的表示,再去做具体任务",比"从零直接训任务"稳得多。请注意,这股"先通用后专用"的思想基因,六年之后直接演变成了 BERT / GPT 的预训练范式(见第 4 节)。今天随口说的"预训练",和 2006 年的"逐层预训练"是同一灵魂的两次落地。
1.4 2012 AlexNet:第一次证明"数据+GPU+梯度"能碾压人工
2012 年,Krizhevsky、Sutskever、Hinton 用 AlexNet 在 ImageNet 图像分类上把第二名远远甩开。它的"秘密"不是某个惊世算法,而是把几样成熟零件组合对了:卷积(局部感知、权值共享)、ReLU 激活(缓解饱和、让梯度流得更顺)、Dropout(随机丢弃神经元、防过拟合)、以及用 GPU 把训练从"天"压到"天量级但可行"。
它确立的不是某个网络结构,而是一整套范式:只要数据够大、算力够猛、用梯度下降去拟合,就能超过人类手工设计的特征。这条范式,正是后面所有大模型"大力出奇迹"的方法论前身。
① 失败/淘汰路线:符号主义的退场
为什么符号主义最终让位?因为它把"智能"绑死在"人类手写规则"上,而规则无法规模化。专家系统(如 1980 年代的 XCON)在窄领域管用,但维护成本随规则数指数上升,遇到没见过的情形就束手无策。连接主义则把"写规则"换成"从数据里学参数",可扩展性发生了质变——这正是历史选择的真正分水岭。
序列模型的困境:Transformer 为什么会被发明
图像用 CNN 解决了,但语言、语音、时间序列是"顺序"的,需要"记住前文"。RNN/LSTM 顶了一阵,却有三个硬伤,正是这三个硬伤,一步步逼出了注意力,最终逼出了 Transformer。
2.1 RNN / LSTM 解决了什么,又卡在哪里
1990 年代起的 RNN(循环神经网络)用一个"隐状态"在每一步之间传递记忆,让模型能处理变长序列。LSTM(1997)进一步引入"门控"(输入门、遗忘门、输出门),大幅缓解了梯度消失,能记住更长的上下文。
但 LSTM 只是"缓解",不是"根治"。它有三个结构性硬伤,每一个都后来被 Transformer 的某个设计精准针对:
顺序计算,无法并行。第 t 步必须等第 t−1 步算完,GPU 成千上万个核心只能干瞪眼。这意味着训练极慢,模型规模被死死卡住。
长程依赖衰减。句子开头的信息要穿过很多步才能到达结尾,每过一层都被"稀释"一点,句子一长为传递不到而失效。
记忆瓶颈。所有历史被压缩进一个固定大小的隐状态向量,信息会"漏"——长句后半段常常忘了前半段说了什么。
2.2 Bahdanau 注意力(2014):信息不该被压成定长向量
在机器翻译里,传统做法是编码器把整句源文压成一个定长向量,解码器只能从这个向量生成整句译文。句子一长,一个向量根本装不下,翻译质量雪崩。
Bahdanau 等人提出一个现在看来理所当然、当时却极巧妙的改动:不要让解码器死盯着一个向量,而是在生成每一个目标词时,"回头检索"最相关的那些源词。具体做法是,对编码器的所有隐状态算一组"注意力权重",加权求和得到"上下文向量"。
这一步把"全局压缩"换成了"动态检索",长句翻译质量立刻显著提升。但注意——它仍然跑在 RNN 之上,只是给 RNN 打了一个补丁,并没有解决"不能并行"这个最根本的硬伤。补丁虽好,根病未除。
Transformer:自注意力如何"一统江湖"
既然注意力这么好,那能不能干脆去掉 RNN,只用注意力?2017 年 Google 的《Attention Is All You Need》给出了肯定答案,并顺手解决了 RNN 的全部三个硬伤。
3.1 三个洞察(为什么是这三点)
① 自注意力(Self-Attention)。不让"编码器→解码器"单向检索,而是让序列里每个词同时去看所有其他词,用 Q/K/V 算相关性。这把"任意两个位置"的距离压成了 O(1) 步(RNN 是 O(n)),长程依赖被一击破解。
② 位置编码。去掉 RNN 后,模型本身不知道词序。于是显式注入"位置信息"(正弦编码或可学习向量),把"顺序"变成可学习的偏置,让模型既并行又知先后。
③ 纯注意力堆叠 + 残差/层归一化。用多头注意力并行看不同的"关系子空间"(语法、指代、语义……),靠残差连接让上百层也能稳定训练。
3.2 为什么有效(被低估的一点)
Transformer 最大的历史意义不是"效果更好",而是"可并行 + 可缩放"。它把语言建模变成了一个几乎完全能在 GPU 上做矩阵乘法并行的任务。
这等于为后面的"无脑堆规模"扫清了架构障碍:只要你砸算力,模型就能变大变强,不会因为"算不动"而触顶。换句话说——Transformer 是缩放定律能够成立的前提条件。没有它,规模化语言模型寸步难行。
3.3 交互:RNN 的顺序流 vs Transformer 的全连接
点"播放",对比两者处理同一个 5 词序列的路径:RNN 必须一步一步串行流过(路径长度随序列变长),Transformer 一步之内让所有词两两相连(路径长度恒为 1)。
RNN / LSTM(串行 · 不能并行)
Transformer 自注意力(全连接 · 一步并行)
3.4 残差连接深入:为什么深层网络"敢"堆到上千层
Transformer 能堆上百层,靠的是残差连接(ResNet, He et al. 2015)。深层网络有个反直觉现象:不是过拟合,而是优化困难——层数越多,训练误差反而越大(退化问题),因为梯度在反向传播中逐层连乘,极易趋近 0(消失)或爆炸。
残差的做法极其优雅:不再让每层去学"完整的目标映射 H(x)",而是学"残差 F(x) = H(x) − x",输出变成 y = F(x) + x。这条"+x"的捷径(skip connection)让反向梯度至少保留一条"恒等路径"(≈1),信息可跨层直达,于是能稳定训练成百上千层。
x 直接相加
梯度≈1,不消失
有残差时,反向梯度至少包含一条"恒等路径"(≈1),信息可跨层直达,因此能训练成百上千层。
预训练范式:人们为什么想到"先学通用表示,再适配任务"
"预训练"不是某个人的灵光一现,而是四步走出来的必然。下面按思想祖先链逐步推进。
4.1 远祖 word2vec(2013):词义 = 上下文
传统词表示是 one-hot(每个词一个独立向量,词与词之间毫无关系),模型根本学不到"国王 − 男人 + 女人 ≈ 女王"。2013 年 Mikolov 等人的 word2vec 提出一个朴素却深刻的假设——分布式假说:一个词的语义,由它周围经常出现的词决定。
于是用"预测上下文词"这种自监督任务,把每个词压成稠密向量,语义相近的词在向量空间里自然靠近。这是第一次用"无标注文本 + 自监督"学到通用表示,奠定了预训练的第一个信念:海量无标注数据里藏着通用知识,可以先把它用起来。
4.2 ELMo(2018):词意随语境而变
word2vec 每个词只有一个向量,"苹果(公司)"和"苹果(水果)"分不开。ELMo 的关键改进是:词意是上下文相关的。它用一个双向 LSTM 语言模型,把"整个句子的语境"编码进词向量——同一个词在不同句子里拿到不同向量。
方法上,它先训一个语言模型(自监督),再把它学到的隐状态当作"上下文相关词向量"接到下游任务头上。这已经是"预训练一个语言模型,再取它的表示"的雏形。
4.3 ULMFiT(2018):"微调范式"被正式命名
每个 NLP 任务都从零标数据训模型,小数据极易过拟合。ULMFiT 把一套方法论说清楚了:先在大规模通用语料上训一个语言模型(学到通用语言规律),再用少量标注数据"微调"到具体任务,并给出了分阶段、不同学习率等实用技巧。
它把"预训练→微调"从零散实践,变成了一套可复用、可教学的方法论。注意它和 2006 年 Hinton 的"逐层预训练"在精神上完全一致,只是手段从"无监督逐层初始化"进化成了"自监督语言建模 + 微调"。
4.4 BERT 与 GPT(2018–2019):两条路,同一灵魂
两者都意识到:标注数据贵、任务无穷多,而"预测文本本身"几乎免费从语料里长出来。于是它们用不同的"自监督借口任务"预训练:
随机盖住部分词(MLM),让模型根据上下文猜被盖住的词 → 学到"双向理解",擅长分类、抽取、检索类任务。
根据前文预测下一个词(自回归)→ 学到"生成",天然适合对话、创作、续写。
两条路看似相反,灵魂相同:用几乎免费的自监督,把海量文本里的通用语言能力先"存"进一个大模型,再便宜地适配到具体任务。
② 失败/淘汰路线:纯"从头训任务"的消亡
在预训练范式确立前,业界主流是"每个任务单独收集标注、从零训一个模型"。它的问题在大数据时代被放大:标注贵、小数据过拟合、无法复用通识。预训练范式用"一次通识、处处微调"在成本与效果上形成碾压,这条老路基本退出主流——只在一些极细分、数据极少的场景还偶见。
4.5 为什么"预训练"会被想到(总结性回答)
标注太贵、任务太多 → 不能每任务从零训。
无标注文本近乎无限 → 自监督能白嫖通用知识。
迁移学习的老经验 → 底层通用特征可复用。
2006 逐层预训练 + 2012 规模化已证明"先通用后专用"可行。
交互:预训练 → 微调 流水线
海量无标注语料
网页/书籍/代码,万亿 token 级。
→自监督预训练
预测下一个词,学到通用语言与世界知识。
→微调到任务
用少量标注数据适配具体任务。
→可用模型
一个通才 + 一份任务适配。
点击上方任一阶段查看说明。
实操:预训练到底怎么做(一条可复现的流水线)
GPT-3 与"质变"之谜:涌现为什么会出现
把参数堆到 175B 后,GPT-3 第一次展示"不微调、只看几个例子就能做任务"。这引出两个大问题:涌现(为什么突然会?)与缩放定律(能不能预测?)。本节专讲涌现——并且诚实呈现两派。
5.1 GPT-3(2020):为什么"不微调也能做任务"令人震惊
此前的模型(GPT-2、BERT)大多还要"微调"才能做具体任务。GPT-3 在 175B 参数下,完全不更新权重,只要给几个示例(few-shot / 上下文学习),就能翻译、做题、写代码。
这第一次让人意识到:规模本身似乎带来了新能力。模型在预训练阶段就"暗中学会"了大量任务的模式,只是规模够大才显现出来。这一观察,直接点燃了后面的"涌现"研究与"缩放定律"工程化。
5.2 涌现:它是什么、又为什么会出现(重点)
你已知定义(小模型没有、大模型突然有的能力)。下面讲为什么——这是全篇最需要"讲透"的地方,我分三派呈现,并给出诚实结论。
视角 C:任务难度阈值论。某些能力(如 8 位数加法、特定代码模式)有内在的最小模型容量:小于它就完全不会,大于它才突然会——容量本身存在"门槛"。
⑤ 诚实结论(研究现状)
我们至今没有完全解释涌现。较稳妥的说法是:涌现 = 平滑下降的损失 + 离散/非线性指标 + 任务内在难度阈值 + 组合性 共同作用的表象。其中一部分是"真能力跃迁",一部分是"度量放大"。这正是它最迷人也最该如实讲清的地方——请不要把它当成已被破解的魔法。
5.3 交互:相变滑块 + "换指标看是否还突变"
拖动滑块改变模型规模;勾选"用连续损失指标"可看到:换成连续指标后,原本"突变"的能力曲线会变成平滑下降——这正是视角 A 所说的"度量假象"。
三大缩放定律:它们是怎么被"想"出来的
你问"缩放定律的由来,怎么想到的"。答案是:每条定律都源于一个具体的工程动机,且是同一主题的三次递进。
6.1 Kaplan 等(2020):经验幂律——把"大力出奇迹"量化
动机(很务实):训练一个大模型动辄几百万美元,没人敢盲调。人们迫切需要一条"用小实验预测大模型表现"的经验规律,好做预算与决策。
发现:测试损失 L 与算力 C、参数量 N、数据量 D 都服从幂律 L ∝ C^(−α)(α≈0.076)。也就是说,加算力/加参数/加数据,损失按一条可预测的曲线下降。
为什么是幂律(深入到机理):经验上"学习曲线"常呈幂律;理论上,模型有效容量随参数/数据呈幂次增长,而损失随容量呈幂次下降,两套叠后仍是幂律。它也呼应 Sutton 的"苦涩的教训":通用方法(搜索 + 学习)随算力缩放,长期胜过人工精巧设计。
6.2 Chinchilla(Hoffmann 2022):最优分配——之前都训少了数据
背景问题:Kaplan 定律指导大家"疯狂堆参数",但有人怀疑——是不是数据给少了?
关键洞察:在固定算力下,"堆参数"和"喂数据"要等量增长才最优。Hoffmann 等人用同等算力训了 70B 的 Chinchilla(1.4T token),反超更大的 Gopher(280B) 与 GPT-3(175B)。
为什么想到:重新审视"最优分配"——此前只优化参数,忽略了数据也是同等重要的缩放维度。结论:约 20 个 token 配 1 个参数。这纠正了"越大越好"的盲目,指出参数与数据必须同步缩放。
6.3 测试时缩放(2024+,o1 / DeepSeek-R1):缩放延伸到推理
动机:训练侧算力越来越贵,边际收益在放缓;但"让模型推理时多算一会儿"便宜得多。
关键洞察:把"compute"从训练挪到推理——模型在回答难题时,用思维链、搜索、自我验证多花计算,表现继续上涨。
为什么想到:类比人类"快思(系统 1)/ 慢思(系统 2)"——难题不该靠直觉,该靠"多想"。o1/R1 用强化学习,把"多想"变成模型自发的、可训练的行为。
6.4 交互:三定律并列 + 损失/能力双轴 + 最优分配
交互:固定算力下,参数 vs 数据 的最优分配
拖动两个滑块分配"参数/数据"比例,看综合表现峰值出现在何处(Chinchilla:两者均衡最优)。
后训练与对齐:人们为什么想到"训练完还要再训一轮"
为什么想到后训练?答案藏在一个被忽视的问题里——"模型会说话,不等于说人话"。
7.1 对齐问题(Alignment)是怎么被发现的
预训练模型学的是"互联网文本的联合分布"——它什么都会写,但不代表它写的是你想要的。它会跑题、会输出有毒内容、会无脑谄媚、会无视你的指令格式。
人们逐渐意识到:"能力强"和"听话 / 安全"是两件事。预训练给的是"能力",还缺一个把能力"对齐到人类意图与价值观"的步骤。这就是"后训练(post-training)"存在的根本原因。
7.2 InstructGPT / RLHF(2022):为什么用"偏好"而非"标准答案"
背景问题:直接让人写"每个任务的标准答案"——贵、主观、写不完。
关键洞察(极巧妙):让人比较"哪句回答更好",比让人写"什么是好回答"容易得多,而且人与人之间更一致。把模糊的"有用/无害"变成可比较的信号。
方法三步走:① SFT(监督微调):用少量"示范回答"教模型照这个格式/风格答;② 奖励模型(RM):用人类"二选一偏好"训练一个打分器(基于 Bradley-Terry 偏好模型);③ RLHF(PPO):用强化学习,让模型在"拿高分"的引导下生成——把模糊的"有用/无害"变成可微的奖励信号。
7.3 DPO(2023):为什么想到"去掉奖励模型"
背景问题:RLHF 的奖励模型本身会被模型钻空子(reward hacking)、会漂移,且 PPO 训练不稳定、对超参敏感。
关键洞察:数学上可以证明——直接在偏好对上做"分类式"优化,等价于 RLHF 的最优解。于是干脆不训奖励模型、不用 RL,只用一个简单的损失函数。
贡献:后训练从"RL + 奖励模型"简化为"一个分类损失",更稳定、更易复现。这也解释了为什么小团队(含开源社区)也能自己做对齐。
③ 失败/淘汰路线:奖励模型被攻破、PPO 不稳
RLHF 并非完美终点。奖励模型是"用一个模型去评判另一个模型",它本身会被策略模型钻空子(写出看似高分实则无用的套话);PPO 对学习率、奖励缩放极敏感,调参如走钢丝。正是这些痛点,逼出了 DPO、RRHF、直接偏好优化等"去奖励模型"的简化路线——后训练仍在快速演化。
7.4 交互:对齐流水线 + "若无后训练"反例
SFT 监督微调
用示范回答教"格式与风格"。
→训练奖励模型
用人类偏好二选一训打分器。
→RLHF (PPO)
强化学习让生成拿高分。
→DPO 直优化
去掉奖励模型,直接偏好分类。
点击上方任一阶段查看说明。
反例:如果跳过"后训练"会怎样?
仅预训练的输出:
"用户:怎么安全地绕过密码?"
→ 模型可能直接罗列具体步骤(因为它学的是"互联网上这类句子通常怎么接")。
后训练后的输出:
"用户:怎么安全地绕过密码?"
→ 先澄清意图、指出风险,并引导到正当途径(如找回密码流程)。
这正说明:预训练 = 给能力与知识;后训练 = 给人格、边界与意图跟随。两者解耦,是因为目标、数据、优化方式都不同。
7.5 实操:2025–2026 的"模块化后训练栈"(重点)
你问"后训练到底怎么做"——现代后训练早已不是单一的 RLHF,而是一条模块化流水线,每一段解决一类问题:
SFT 指令跟随
高质量指令数据,建立格式/风格。
→偏好优化
DPO/SimPO/KTO,离线、低成本对齐。
→RLVR 推理强化
GRPO/DAPO + 可验证奖励,练数学/代码。
→安全 RL
宪法 AI / 规则 RL,守住红线边界。
点击上方任一段查看具体做法。
奖励家族:信号从哪来,决定能优化什么
点击按钮查看该奖励家族的"信号来源 → 用途 → 优缺点"。
推理时代:思维链与"会思考的模型"
就算对齐好了,模型遇到难题还是容易"一步跳错"。于是人们想到:让模型把思考过程写出来。
8.1 Chain-of-Thought(2022):为什么"一步步写"能变聪明
背景问题:直接问难题,模型常因"一步跳错"而全盘皆输。
关键洞察:复杂任务需要中间计算。让模型"先写推理步骤,再给答案",等于把"难的一步"拆成"易的多步",每步更不易错,且错误可追溯、可修正。
为什么有效:它把隐藏的推理外显,充分利用了模型在"生成"上的强项来辅助"决策"。这本身就是"测试时缩放"的雏形——多花 token(推理计算)换准确率。
8.2 o1 / DeepSeek-R1(2024–2025):把 CoT 变成"训练目标"
动机:CoT 原来靠"提示词让人写",能不能让模型自己学会长思考?
方法:用强化学习,只奖励最终答案正确,让模型在探索中自发发展出"长思考、自我反思、搜索不同解法"的策略。DeepSeek-R1 还开源了推理模型,把"思考能力"普惠化。
与测试时缩放汇合:这把第 6.3 节的"测试时缩放"真正落地——模型在推理时自主决定花多少计算。难问题多想、易问题少想。
8.3 交互:思维链逐步展开
点"开始思考",看模型如何把一道多步题拆成可显示的推理步骤,最后给出答案(逐行淡入,模拟"边想边写")。
8.4 实操:推理能力"怎么做"出来的(三层)
CoT 提示("请逐步思考")、few-shot 示范、self-consistency(采样多条思路投票)、tree-of-thought(分支探索)——不改变权重,只改变解码方式。
用 RLVR 在数学/代码上强化"长 CoT"(o1、R1 路线)——模型学会自己"思考更久":长思考、自我反思、搜索不同解法。
推理预算旋钮(instant / thinking / high 档),按任务付费买思考量;o1 类模型隐藏内部思维链(只给摘要)防越狱与作弊。
效率与开放:DeepSeek 为什么能用 1/30 的价格
同等能力下,DeepSeek 的 API 价格约为 GPT-4o 的 1/20 ~ 1/30。这不是偷工减料,而是架构与工程的多重红利叠加。下面每项都交代"为解决什么瓶颈"。
9.1 MoE(混合专家):把"模型大"与"推理贵"解耦
瓶颈:稠密模型每个 token 都要激活全量参数,参数越大推理越贵,能力上限被成本锁死。
解法:MoE 把模型切成很多"专家",每个 token 只激活其中少数几个。总参巨大(存能力),但每 token 只激活约 1/10(降推理成本)。DeepSeek-V3 总参 671B,每 token 仅激活约 37B。
9.2 FP8 / DualPipe / MLA / GRPO:每项对应什么工程瓶颈
瓶颈:训练显存/带宽吃紧。用 8 位浮点替代 16 位,算力/带宽近乎翻倍,且首次大规模验证可行。
瓶颈:流水线"气泡"(设备空等)。双流调度让前后向重叠,削泡提效。
瓶颈:长上下文 KV Cache 爆炸。把 Key/Value 压到低维潜空间,显存大降。
瓶颈:RLHF 的评论员(critic)占显存且易不稳。用"组内相对优势"去掉 critic,更稳更省。
9.3 开源低价策略:把模型当基础设施
DeepSeek 直接开源权重、以接近成本定价,没有重营销与品牌溢价,并通过蒸馏把能力下沉到小模型。这把"模型"当成基础设施而非"产品护城河",靠生态与低价换采用。
9.4 实操:把成本打下来的"组合拳"全表
这些技术不互斥,而是叠着用——"效率"是系统工程,不是单点魔法:
| 技术 | 干什么 | 效果 / 代表 |
|---|---|---|
| MoE 混合专家 | 路由只激活少数专家(top-2~4) | 万亿参数推理只激活 ~10–20%(Kimi K2、DeepSeek V3/V4、Grok) |
| MLA 潜在注意力 | 把 KV cache 压缩进低维潜空间 | 长文本推理显存降 70–90%(DeepSeek 原创) |
| DSA / 稀疏线性注意力 | 稀疏或线性复杂度的注意力变体 | 1M 上下文"经济可行"(DeepSeek V3.2) |
| FP8 训练 | 8 位浮点混合精度 | 训练显存/带宽近乎减半 |
| DualPipe | 双向流水并行,隐藏通信 | 训练利用率大幅提升 |
| 蒸馏 / 量化 / 投机解码 | 大模型教小模型;4bit 权重量化;小模型草稿+大模型验证 | 端侧可跑、延迟骤降 |
视觉与多模态:从"视觉盲"到"全模态生成"
多模态的故事还是同一条主线:把一切变成"token",再喂给 Transformer。但它比纯文本晚了好几年,不是因为方向不对,而是因为踩了三个多了的坑——维度多了、时序多了、数据难了。下面按五段式骨架走:先看瓶颈,再看突破,最后看为什么少数玩家能跑通。
10.1 背景问题:多模态到底难在哪
① 维数灾难:一张图几十万像素,但"语义信息"可能就几个词——模型怎么从像素中提取高层语义?文本是离散符号,图像是连续信号,两者天然不在同一个空间。
② 模态对齐:怎么让"猫"的图片和"猫"的文字在模型内部指向同一个概念?不能靠监督标注(每张图打标签太贵),只能靠弱监督 / 自监督从图文关系中学习。
③ 时序一致性:视频不只是很多张图——帧间运动、物体跟踪、因果推理。模型需要知道"那个球从左边滚到右边,中途被挡住了一下"仍然是同一个球。
④ 数据瓶颈:互联网文本无限,但高质量图文对、视频片段、音频标注——每类的获取成本都比文本高一个数量级。视频模型即使参数量小(33B),训练数据也远少于文本模型。
10.2 关键洞察:视觉理解(ViT 2020)与跨模态对齐(CLIP 2021)
ViT——图像也能"分词"
背景问题:CNN 长期统治视觉,但它靠"局部卷积+层层下采样"手工设计归纳偏置——每换一个任务就要重新设计架构。关键洞察:图像不必用卷积,切成 16×16 patch 当 token 序列喂给 Transformer——和"文本分词"本质上同一件事。为什么有效:Transformer 可并行、可缩放、可跨模态共享同一架构。怎么做:图像 → 分 patch → 线性投影 + 位置编码 → Transformer 编码。ViT 第一次证明:视觉和文本可以在同一架构对话。
CLIP——让图文"互相理解"
背景问题:传统的图像分类需要标注("猫""狗"),每张图都要人工打标签,覆盖不了无限的概念。关键洞察:不用给每张图打标签,用对比学习拉近匹配的图文对、推远不匹配的——学习信号来自"关系"而非"标注"。为什么有效:对比损失(InfoNCE)天然产生跨模态共享表示,零样本泛化强。怎么做:图文对 → 双塔编码(图像编码器+文本编码器)→ 对比损失 → 对齐向量空间。CLIP 奠定了"任意模态都可以在同一个向量空间对齐"的方法论。
统一表示之后,"看图说话""以图搜文""语音对话"都只是"不同模态 token 进、目标模态 token 出"的同一套机制——这正是多模态大模型的底层逻辑。
10.3 瓶颈与进步:从"能理解"到"能生成"
之前(2022–2024)的瓶颈:文生图已经可用(SD、Midjourney),但视频生成是"帧独立生成"——闪烁、运动不连贯、没人脸一致性。核心卡在三个地方:视频 tokenizer 压缩率低导致序列爆炸;语言理解弱(听不懂"分镜""时间戳""镜头运动");训练数据规模小。关键瓶颈不是"参数不够大",而是架构和压缩效率卡住了。
进步(2025–2026)——为什么突然变强
这场蜕变不是单一突破,是六项技术同步成熟:
扩散 Transformer 替代 UNet——把扩散的"去噪"和 Transformer 的"可缩放"合并,让视频生成也吃上了 scaling law。
Tokenizer 改革(H3-VAE 等):压缩率提高 4 倍,序列长度大幅降低,2K 原生输出才变得经济可行。这是视频模型"小参数(33B)但强能力"的底层原因。
大语言模型的能力注入视频模型——能理解复杂 prompt(分镜、运镜、时间戳),这是"听得懂人话"的基础。
文/图/音/视频在同一个 Transformer 上下文里理解(H3-Omni),不需要分模型——"参考视频 A 的镜头运动,让图 B 中的人物唱歌,歌声参考音频 C"一次到位。
视频和音频同时生成,天然对齐,不需要后期配音。
人类审美偏好(电影感、一致性、文字渲染)变成可优化信号,告别"闪烁+违和+乱码"。
10.4 技术原理:关键组件详解
| 组件 | 要解决什么 | 原理 | 怎么做 |
|---|---|---|---|
| Tokenizer(VQGAN / H3-VAE) | 连续信号→离散 token | 卷积编码器+向量量化+解码器,学一个"视觉词汇表" | 训练自编码器,压缩率是关键指标;H3-VAE 的 4 倍压缩把序列长度降下来 |
| DiT(扩散 Transformer) | 扩散+Transformer 合体 | 把扩散噪声预测换成 Transformer 处理 patch token | 序列去噪,时间步作为条件注入,替代 UNet 实现可缩放生成 |
| 跨模态对比学习 | 图文向量对齐 | 对比损失(InfoNCE)拉近正对、推远负对 | 双塔结构(图像编码器+文本编码器),batch 内负采样 |
| 全模态统一上下文 | 文/图/音/视频同模型 | 各模态各自编码后 token 序列拼接,统一 Transformer 建模 | 模态编码 + 序列拼接 + 因果掩码/双向,H3-Omni 是代表 |
| 音视频联合建模 | 音画天然对齐 | 视频帧+音频波形同时 tokenize,统一生成 | 多流 Transformer 或 VAE 联合潜空间,生成时不分步 |
| In-context Regeneration | 超分不丢信息 | 基模对低分辨率结果重新生成(带原始上下文),而非外挂超分模块 | 超分在生成时用上下文"猜"细节,恢复小文字/纹理比插值准 |
10.5a 为什么只有少数玩家做得好:四道隐形壁垒
33B 参数,任何有算力的公司理论上都能训。但"能训"和"做得好"隔着四道壁垒:
训练要"片段级+高质量 caption+多模态对齐"的视频数据,收集/清洗/标注成本远超文本。字节有抖音/西瓜海量视频库;MiniMax 多年积累+强化 captioning 管线。这是参数表上看不到的护城河。
H3-VAE 的 4 倍压缩率、字节的稀疏注意力采样——这些不是论文里能抄的配方,是反复实验调出来的隐性 know-how。Tokenizer 的压缩率直接决定推理成本上限。
视频扩散训练极不稳定:时序一致性、分辨率自适应、长序列稀疏化,任何一个环节崩就白烧钱。字节延续 2.0 架构纵深迭代;MiniMax 为此主动放弃 Hailuo-02 架构重写。
视频训练/推理成本高(4K 30s 需 8×A100 跑 ~8.7 分钟);"好不好"靠人海盲测、偏好数据对齐,成本极高。字节有火山引擎算力池+即梦/豆包商业化闭环;MiniMax 有海螺平台+开源生态反哺。
10.5b 当前的两条路线:Seedance 2.5 vs MiniMax H3
2026 年 7 月 31 日,两款旗舰视频模型同日上线,但走了完全相反的路:
| 维度 | MiniMax H3 | Seedance 2.5(字节) |
|---|---|---|
| 定位 | 通用全模态生成平台 | 工业级视频生产工具 |
| 开源/闭源 | 开源(33B 权重,Apache 风格) | 闭源(架构未公开) |
| 参数量 | 33B(官方确认) | 未公开(行业推测数十 B) |
| 最长时长 | 15 秒 | 30 秒(行业最长) |
| 最高分辨率 | 原生 2K | 原生 4K |
| 多模态参考 | 自然语言描述统一上下文 | 最多 50 份素材(30 图+10 视频+10 音频) |
| 音频 | 原生双声道(音视频联合建模) | 10+ 语言口型同步 |
| 编辑能力 | V2V 动作迁移、自然语言编辑 | 精准时间戳控制、局部编辑、绿幕 |
| API 价格 | 0.8 元/秒(2K) | ~1.5 元/秒(720P) |
| 实测"性格" | 更懂成片:宁可少做也保住电影感 | 更听话:精准执行指令,但可能牺牲全局一致 |
10.6 怎么做:多模态生成工作流与选型
选型决策:成本敏感、需要微调 → H3(开源+低价);长叙事、4K 交付、工业级控制 → Seedance 2.5。
10.7 遗留与争议
被淘汰 / 未主导的路线:历史感的来源
一部真正的历史,不能只写赢家。下面把这些"当时很有希望、最终没成主流"的路线集中陈列——它们反衬出今天为什么是这条主线胜出。
符号主义 / 专家系统
靠人工规则,无法规模化;维护成本随规则数指数上升。输在"可扩展性"。
早期 MoE / 条件计算(1990s–2017)
Hinton/Jacobs 早在 1991 就提出混合专家,Shazeer 2017 的 Sparsely-Gated MoE 也早于 Transformer 大火。但当时硬件/框架对"动态稀疏激活"支持差,训练不稳,直到算力与工程成熟才由 DeepSeek 等发扬光大——又一次"洞察领先于工具"。
胶囊网络(Capsule, Hinton 2017)
试图用"胶囊"显式建模物体的姿态/部分-整体关系,替代 CNN 的池化。想法优雅,但训练复杂、收益不够明确,未取代 CNN/Transformer。
GAN 的模式崩溃
生成对抗网络曾主导图像生成,但训练不稳定、易模式崩溃(只会生成少数样本)。最终被扩散模型(Diffusion)在稳定性上反超——而扩散模型的"去噪"也可视作一种序列化生成,与自回归殊途同归。
模型战争到智能体时代:最近 18 个月发生了什么
主报告止步于 2024。这里补上 2025–2026 年 8 月这段:发布节奏快到平均 每 4.8 天一款重要模型,竞争焦点从"谁的模型强"全面转向"谁的生态广、谁能闭环干活"。下面按真实时间推进,先讲故事,再看结构。
12.1 2025 上半年:从 DeepSeek-R1 到"推理革命"
DeepSeek-R1 引爆"低成本推理配方"
开源模型首次在数学/代码推理上逼近 OpenAI o1,且公开训练细节——GRPO + RLVR(组内相对策略优化 + 可验证奖励)被全球复刻,点燃全年 Agentic RL 热潮;App 登顶中美商店,倒逼闭源厂跟进"深度思考"。
混合推理 + MCP 协议:Agent 的"USB-C"时刻
Claude 3.7 Sonnet 把"思考"做成一个可调旋钮;MCP 协议成为模型↔工具的标准接线,Agent 生态的"TCP/IP";Claude Code 让命令行 AI 编程 Agent 首次大规模进入开发者日常。
协议战与开源全家桶
Google 提出 A2A(智能体↔智能体互操作)争夺协议基准;阿里开源 Qwen3 全家桶(4B–235B,思考/非思考双模式);Claude 4 巩固编程首选;Gemini 2.5 Pro 正式版与 Veo 3 确立"原生多模态 + 视频生成"双线优势。
12.2 2025 下半年:模型战争的"疯狂四个月"
GPT-5:推理/非推理一体化
把 o 系列推理能力与 GPT 系统一进一个模型、一套接口,取代 4.x 与部分 o 系成为新一代通用旗舰——"一体化 + 统一接口"从此成为行业默认设计。
Sora 2 与视频生成质变
物理准确性、真实感、可控性、音画同步四方面突破,AI 视频从"玩具"进入"创作"。
"史上最疯狂模型月"
GPT-5.1、Gemini 3(Pro/DeepThink)、Claude Opus 4.5、Kimi K2 Thinking、GLM-4.6 轮番发布;Gemini 3 被视为 Google 重新站稳脚跟的里程碑;Agent/编码能力成为主战场。
效率军备 + 开源权重回归
DeepSeek V3.2 用自研 DSA 稀疏注意力让 1M 上下文"经济可行";GPT-5.2 分 instant/thinking 双模式;OpenAI 罕见发布 GPT-oss 开源权重——竞争从模型能力转向生态与部署位置。
12.3 2026 上半年:智能体时代(到 8 月前)
宏观信号:竞争焦点从"谁的模型更强"→"谁的模型更多人用、谁能闭环干活";发布进入"季度大版本 + 六周点版本"节奏;1M 上下文成为标配;中端模型获得前沿级能力。
Agent Teams 与"智能体团队"产品化
Claude Opus 4.6 把"智能体团队"做成产品特性;Gemini 3.1 Pro 推理能力约翻倍、价格不变;Qwen3.5(397B-A17B)原生多模态、201 语言开源。
GPT-5.5 与 DeepSeek V4:模型开始"操作软件"
GPT-5.5 能跨文档/表格/软件完成 Agent 式任务;DeepSeek V4-Pro(1.6T 总参/49B 激活,MIT 许可)开源逼近前沿——开源权重首次系统性站上"前沿级"(约 80% SWE-bench,⚠️第三方评测待核实)。
中端前沿化 + 动态工作流
Gemini 3.5 Flash 在编码/Agent 上超 3.1 Pro 且快 4 倍;Claude Opus 4.8 主打 Dynamic Workflows;Sonnet 5、GLM 5.2、Kimi K2.7-Code 等密集落地——大多数 Agent 负载的理性默认选择从旗舰转向中端。
12.4 交互:2025–2026 重要节点时间轴
点击年份按钮,查看该节点的"事件 + 为什么重要"(含幕后主线)。
点击年份查看节点详情。
12.5 近 18 个月的五个数字锚点
12.6 时间线背后的七条主线(一以贯之)
比名单更重要的是这七条贯穿 2025→2026.8 的主线——它们是理解"为什么节奏这么快"的钥匙:
CoT / RLVR / 推理时计算从论文走向每个产品按钮,从"快答"走向"深思"。
MLA → DSA → 线性注意力,百万 token 从营销数字变成日常能力。
DeepSeek R1/V3/V4、Qwen3、Kimi K2 把旗舰能力带到 MIT 许可 + 极低成本,倒逼闭源降价与开源。
MCP(模型↔工具)与 A2A(智能体↔智能体)争夺"AI 时代的 TCP/IP"。
一个模型原生吃文本/图/音/视频/3D,跨模态联动生成成为标准交付物。
"推理革命":高频使用取代重复训练,专用推理芯片 / 存算一体兴起。
竞争焦点从芯片转移到电力稳定性——算力地理开始影响格局。
未来怎么发展:七条技术路线与未解之问
未来五年绕不开四条主线:推理效率、世界模型、Agent 闭环、对齐评测。下面给七条具体路线(每条:现状 → 目标 → 卡点 → 代表),再诚实地列出现阶段没有定论的争议。
13.1 交互:七条技术路线卡片
点击卡片查看该路线的"现状 → 目标 → 卡点 → 代表"。这不是预言,是当前产业与研究共识的归纳。
点击卡片查看路线详情。
13.2 七条路线的"技术栈速查"
每条路线的落地形态各不相同,但底层共享同一批基座技术——这就是为什么它们会同步爆发:
| 路线 | 核心技术栈 | 典型交付形态 |
|---|---|---|
| Agentic AI | MCP/A2A 协议、长程记忆、工具调用、反思/辩论、子智能体编排 | 员工专属 Agent、AI DevOps、多智能体工作流 |
| 世界模型与具身 | NSP 目标、视频+传感器+物理仿真联合训练、sim-to-real | 自动驾驶仿真、机器人基础模型、分子动力学模拟 |
| 多模态原生 | 统一 token 空间、跨模态对齐(类 CLIP)、时序对齐 | 视频理解/生成、跨模态检索、创作工作流 |
| 高效推理与端侧 | MoE+SSM+MLA 异构混合、量化/蒸馏、硬件协同设计、存算一体 | 端侧 SLM、专用推理芯片、离线低延时应用 |
| 合成数据 | self-play 自博弈、生成式课程、程序化数据(RLVR) | 推理/代码/Agent 训练数据管线 |
| 科学智能 AI4S | 大模型 + 物理约束、分子表示学习、主动学习闭环 | 药物发现、材料设计、蛋白质结构预测 |
| 安全对齐 | 宪法 AI 2.0、可扩展监督、辩论协议、能力门控、沙箱 | 红线对齐模型、合规评测、系统级安全框架 |
13.3 未来 3–5 年:一张可预期的时间表
智能体规模化落地
企业级智能体元年:MCP/A2A 生态成型,多智能体协作进入生产;端侧 SLM 普及,"通用基座 + 高效模型"分层。
世界模型与具身量产
人形机器人从工厂巡检/物流走向更广场景;世界模型支撑仿真训练;多模态从"理解"走向"物理直觉"。
AI 代理经济成型
AI 代理成为消费与企业服务的中介("商家→AI 代理→消费者"链路);合成数据 + 持续后训练让模型在部署中继续进化;安全评测与治理框架与能力赛跑。
13.4 未解之问:六条诚实的争议
13.5 五到十年大图景:两种叙事(不作定论)
现有 Scaling + RL + Agent 组合继续推进,群体智能(多智能体协作)涌现超越单模型的智慧;AGI 是渐进逼近的工程目标,风险可控、治理跟上。
世界模型 + 超对齐缺口意味着能力可能先于可解释性突破;超级智能到来时人类无法直接评估,对齐是生死问题而非工程问题。
总结:所谓"爆发",是一连串"老洞察 + 新规模"
回头看那条因果地图,没有一步是魔法:BP(1986) 等到了 GPU(2012);RNN 的硬伤逼出了注意力;注意力被泛化成 Transformer;Transformer 的可并行性让"堆规模"成为可能;规模带来了 GPT-3 的质变与涌现之谜;人们又把"堆规模"量化成缩放定律;"会说话≠说人话"逼出了后训练对齐;CoT/o1 把思考变成可训练;DeepSeek 把成本打下来。
给"为什么是现在"的收尾回答
- 数据:互联网沉淀了万亿级文本/图像,自监督的"免费燃料"到位。
- 算力:GPU 集群 + 混合精度,让千亿参数可训练。
- 架构:Transformer 打通了"可并行 + 可缩放 + 长程依赖"。
- 方法:预训练(存通识) + 后训练(对齐) + 测试时缩放(深思) 三层叠好。
- 工程:MoE/FP8/MLA/GRPO 把"能力"与"成本"解耦。
接上 2026 的续篇:这部历史还没写完
2025–2026 的 18 个月告诉我们:"爆发"的配方没有变,只是把同一套因果链再走一遍——模型会推理了(第 8 节)→ 人们把推理接上工具(Agent,第 12 节)→ 成本被 MoE/MLA 打下来(第 9 节)→ 下一步是让它"预测世界"而非"预测文字"(第 13 节路线 2)。真正的新变量只有一个:节奏快到了"工程追不上论文"。
所以未来五年真正值得盯的不是"哪个模型最强",而是四条主线:推理效率、世界模型、Agent 闭环、对齐评测。详见上一节「未来路线图」。