📷 封面图:image-1---c1f0dd22-7a8b-492b-b8cb-64ea117db125.png(本地生成)

国产算力里程碑 | 智谱 GLM-5.3-Flash 跑通 10 万张国产卡,国产大模型 + 国产算力的"首次全链路闭环"

整理时间:2026-09-01 17:40(北京时间)|分类:AI 基础设施|状态:已发布

一句话概括:8 月 26 日智谱上线并开源 GLM-5.3-Flash(320B-A18B MoE),全部线上流量由超过 10 万张国产芯片承载——模型匿名发布期间在 OpenRouter、OpenCode 累计调用量达 62T Tokens,刷新双平台流量纪录,定价仅为同系列旗舰 GLM-5.3 的 1/10。

为什么值得关注:这不是"国产大模型用国产卡训"的常规故事,而是"国产大模型用国产卡服务全球用户"的全链路验证——10 万卡级推理集群、300B 参数 MoE、对标 Claude Opus 4.8 的评测分数,国产 AI 基础设施首次具备承接海外真实流量的能力。


详细解读

架构端重新设计:GLM-5.3-Flash 不是从旗舰模型蒸馏,而是采用稀疏注意力+线性注意力混合架构——线性注意力以递归机制捕获局部依赖,稀疏注意力用轻量级索引器召回全局上下文,IndexPool 把索引器缓存压缩到 1/4;EPD 分离式架构(Encode-Prefill-Decode)将多模态编码、prompt 预填充、逐 token 解码拆为独立可扩缩容工作池。

工程侧极限优化:W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split、ReplaySSM、以算力换带宽、以通信换显存——同硬件基线端到端性能提升 3 倍,单 Token 成本与主流英伟达 GPU 持平。GLM-5.3 驱动的 infra agent 还协助工程师开发算子、诊断瓶颈、改进部署栈,形成"模型优化系统,系统承载模型"的正向循环。

生态侧快速渗透:模型以 MIT 协议开源,已接入 ZCode 等编码平台、纳入 GLM Coding Plan(每天限量 1 万张体验卡)、同步开放 API;早期版本以"Ox Alpha/牛来"匿名登录海外平台 5 天突破 50T Tokens——证明海外开发者对"低价高性能 + 国产算力"组合的需求远被低估。

国产算力的真实检验:行业信息显示,10 万卡集群算力来自华为昇腾、海光、摩尔线程等多家厂商——这意味着智谱不仅验证了"国产卡能跑大模型",还验证了"国产卡能跨厂商混部跑大模型",对国内算力供给侧的多元化格局是关键背书。

这意味着什么

  • **从 PPT 到 SLA**:智谱此役真正意义不在"模型多强",而在"国产推理栈第一次具备全球级 SLA 能力"。当 10 万张国产卡、300B 参数 MoE、对标 Claude Opus 4.8 的分数、单 Token 成本持平英伟达这四个事实同时成立,"国产 AI 基础设施可用性"就从 PPT 进入了 SLA 合同级。
  • **国产芯片需求结构性升级**:工信部 AI 应用服务商培育专项行动启动(年底服务商突破 2000 家)、国产 AI 芯片需求达 400 万颗、实际交付约 300 万颗——智谱案例将为国产推理芯片打开规模化采购通道。
  • **价格线重新划定**:300B 参数 + MIT 协议 + 单 Token 成本持平英伟达,意味着"前沿 AI 模型进入普惠时代"——海外前沿模型难以维持的定价体系将被快速重构。

原文链接:https://www.zhipuai.cn/zh/research/163