为什么大模型几乎都是 Decoder-only?
🧠 核心问题
2020 年之前,NLP 的主流架构是三分天下:BERT(Encoder-only)、T5(Encoder-Decoder)、GPT(Decoder-only)。到了 2026 年,几乎所有头部大模型——GPT-4、Claude、LLaMA、Gemini(最终版本)、Qwen——都选择了 Decoder-only。这不是偶然,而是一系列工程和理论因素的收敛结果。
📊 五大核心原因
1. Scaling 效率最优
Decoder-only 在 Scaling Law 上表现最优——参数量和数据量增加时,性能提升最稳定。OpenAI 2020 年的 Kaplan Scaling Law 论文明确显示:相同计算预算下,Decoder-only 的 loss 下降曲线最平滑。Encoder-Decoder 的 scaling 曲线在中等规模就开始趋于平缓,同等算力投入的回报递减更快。
2. 训练信号密度
Causal LM 的训练方式:每个 token 都参与 loss 计算。一段 1024 token 的文本 = 1024 个训练样本。Encoder-Decoder 中,encoder 部分不直接产生 loss(只有 decoder 的交叉熵),训练信号密度降低了一半。在大规模训练中,这意味着同样的数据量,Decoder-only 提取到的学习信号更多。
3. 推理统一性
不管是什么任务——续写、问答、翻译、代码生成——都是同一个范式:「给前文,预测下一个 token」。不需要区分 encoder 和 decoder 两个阶段,不需要为不同任务设计不同的输入格式。这使得 In-Context Learning(ICL)天然适配:通过 few-shot prompt 就能定义任务行为,不需要修改模型结构。
4. 涌现能力的实证
GPT-3(2020)的论文证明了 Decoder-only 在 175B 规模下的 In-Context Learning 涌现——不需要 fine-tuning,仅通过 prompt 就能完成各种下游任务。这个发现直接推动了整个行业转向 Decoder-only。BERT 和 T5 在同等规模下没有展现出类似的涌现能力。
5. 工程简化
只有一个 Transformer 堆栈,KV Cache 只维护 decoder 侧,推理优化更简单。vLLM、TensorRT-LLM、SGLang 等推理框架都是围绕 Decoder-only 的 KV Cache 管理设计的。如果换 Encoder-Decoder,整个推理优化栈需要重新设计。工程惯性也是护城河。
🏗️ 架构对比
- Encoder-only(BERT):双向理解强,适合分类/匹配,但无法自回归生成
- Encoder-Decoder(T5/BART):翻译/摘要等序列到序列任务天然适配,但 scaling 效率差
- Decoder-only(GPT/Claude):统一的 next-token prediction 范式,scaling 效率最优,工程生态最成熟
🔑 关键洞察
🤔 引发思考
Decoder-only 的统治地位是否会被打破?目前有两个潜在挑战者:
- State Space Models(Mamba 系列):线性复杂度,理论上可以替代 Transformer 的二次复杂度注意力,但 ICL 能力是否能匹配 Decoder-only 仍待验证
- Diffusion LLM(如 Diffusion Transformer):非自回归生成,理论上可以并行解码,但训练稳定性和质量仍有差距
短期内(2-3 年),Decoder-only 的地位不会被撼动。但随着推理成本成为瓶颈,新的架构范式可能会从「推理效率」而非「训练效率」的角度发起挑战。
逍遥云初 | 2026.04.13





