为什么大模型几乎都是 Decoder-only?

来源:抖音「每日AI」评论区讨论(2026.04.13) 关键词:Decoder-only · Encoder-Decoder · Scaling Law · 架构选型

🧠 核心问题

2020 年之前,NLP 的主流架构是三分天下:BERT(Encoder-only)、T5(Encoder-Decoder)、GPT(Decoder-only)。到了 2026 年,几乎所有头部大模型——GPT-4、Claude、LLaMA、Gemini(最终版本)、Qwen——都选择了 Decoder-only。这不是偶然,而是一系列工程和理论因素的收敛结果。


📊 五大核心原因

1. Scaling 效率最优

Decoder-only 在 Scaling Law 上表现最优——参数量和数据量增加时,性能提升最稳定。OpenAI 2020 年的 Kaplan Scaling Law 论文明确显示:相同计算预算下,Decoder-only 的 loss 下降曲线最平滑。Encoder-Decoder 的 scaling 曲线在中等规模就开始趋于平缓,同等算力投入的回报递减更快。

2. 训练信号密度

Causal LM 的训练方式:每个 token 都参与 loss 计算。一段 1024 token 的文本 = 1024 个训练样本。Encoder-Decoder 中,encoder 部分不直接产生 loss(只有 decoder 的交叉熵),训练信号密度降低了一半。在大规模训练中,这意味着同样的数据量,Decoder-only 提取到的学习信号更多。

3. 推理统一性

不管是什么任务——续写、问答、翻译、代码生成——都是同一个范式:「给前文,预测下一个 token」。不需要区分 encoder 和 decoder 两个阶段,不需要为不同任务设计不同的输入格式。这使得 In-Context Learning(ICL)天然适配:通过 few-shot prompt 就能定义任务行为,不需要修改模型结构。

4. 涌现能力的实证

GPT-3(2020)的论文证明了 Decoder-only 在 175B 规模下的 In-Context Learning 涌现——不需要 fine-tuning,仅通过 prompt 就能完成各种下游任务。这个发现直接推动了整个行业转向 Decoder-only。BERT 和 T5 在同等规模下没有展现出类似的涌现能力。

5. 工程简化

只有一个 Transformer 堆栈,KV Cache 只维护 decoder 侧,推理优化更简单。vLLM、TensorRT-LLM、SGLang 等推理框架都是围绕 Decoder-only 的 KV Cache 管理设计的。如果换 Encoder-Decoder,整个推理优化栈需要重新设计。工程惯性也是护城河。


🏗️ 架构对比

  • Encoder-only(BERT):双向理解强,适合分类/匹配,但无法自回归生成
  • Encoder-Decoder(T5/BART):翻译/摘要等序列到序列任务天然适配,但 scaling 效率差
  • Decoder-only(GPT/Claude):统一的 next-token prediction 范式,scaling 效率最优,工程生态最成熟

🔑 关键洞察

Decoder-only 的胜利不是「架构更好」,而是「在 scaling 场景下综合收益最高」。BERT 在小规模 NLU 任务上依然很强,T5 在翻译/摘要上仍有优势。但在 100B+ 参数、万亿 token 训练的场景下,Decoder-only 的 scaling 效率 + 训练信号密度 + 推理统一性形成了压倒性优势。
工程生态的锁定效应不可忽视。当 vLLM、TensorRT-LLM 等推理框架都围绕 Decoder-only 的 KV Cache 设计时,切换架构的成本不仅是模型本身的改造,而是整个推理栈的重建。这是 Decoder-only 护城河的工程维度。
Google 是唯一的「异类坚持者」——T5、PaLM(后转 Decoder-only)、Gemini(混合架构)。这说明 Encoder-Decoder 在特定场景仍有价值,但这些场景正在被 Decoder-only 的 In-Context Learning 逐步侵蚀。

🤔 引发思考

Decoder-only 的统治地位是否会被打破?目前有两个潜在挑战者:

  • State Space Models(Mamba 系列):线性复杂度,理论上可以替代 Transformer 的二次复杂度注意力,但 ICL 能力是否能匹配 Decoder-only 仍待验证
  • Diffusion LLM(如 Diffusion Transformer):非自回归生成,理论上可以并行解码,但训练稳定性和质量仍有差距

短期内(2-3 年),Decoder-only 的地位不会被撼动。但随着推理成本成为瓶颈,新的架构范式可能会从「推理效率」而非「训练效率」的角度发起挑战。


逍遥云初 | 2026.04.13