阿里巴巴放在 CPU 内存中的 510 亿参数查找表
梳理了为何将 510 亿参数的 N-gram 查找表置于服务器 CPU 内存而非 GPU 中,以及九分之一、8.6 倍等公布数据究竟衡量了什么。
AI与科技阿里巴巴为何将 510 亿参数置于 GPU 之外的 CPU 内存中
周三午夜(韩国时间),阿里巴巴 Qwen 团队开源了 Qwen3.8-Flash-Next 的权重。它并非成熟的旗舰模型,而是在下一代 Qwen4 正式应用前先行公开以验证设计的模型。其总参数量为 1250 亿,但处理单个 Token 时实际激活的只有 60 亿,并在此基础上附加了一个用于预先记住高频 Token 组合的 510 亿参数 N-gram1 内存。
在规格表中,引起我注意的一点是这 510 亿参数的存放位置。官方说明指出,它们被存放在服务器的普通内存中,而非 GPU 显存。我曾先后两次撰文指出“AI 的真正瓶颈不是计算芯片,而是 HBM”2。如今,业界出现了一种试图通过架构设计而非硬件芯片来绕开该瓶颈的尝试。
这次发布中最值得关注的不是性能跑分,而是成本结构。部分参数被移出了 GPU 的 HBM、改存到服务器普通内存中;公布的各项对比倍数分别是以什么为基准测得的,需要仔细拆解;而在同一个夜晚亮相的两款 Flash 模型,价格几乎完全一致,开源协议却大相径庭。
为什么有 510 亿参数位于 GPU 之外
语言模型在处理每个 token 时,都会先从词表中取出一个向量。Qwen 则在此基础上又增加了一张词表。这是一张包含 2,000 万个条目的表,将前两三个 token 的组合作为键(key)。通过对最后几个 token 进行哈希运算生成地址,再从表中取出向量并融合到第二层的表征中。因为这只是一次读取而非矩阵乘法,所以每个 token 的计算量几乎没有增加。
这张表存放在哪里至关重要。由于地址是确定性的,只要知道了 token 就能确定要读取的条目,因此在 GPU 计算第一层时,就可以提前从 CPU 内存中将其预取出来。这种预取3与第一层的计算相重叠,从而隐藏了数据传输延迟。vLLM 的部署方案中就体现了这一结果:GPU 端的 FP8 检查点依旧是 172.78 GiB,同时仅增加了一行说明:“用于 N-gram 卸载的主机内存需 51 GB 以上”。
若与混合专家模型(MoE)4进行对比,其意义便一目了然。MoE 虽然也降低了每个 token 的计算量,但 512 个专家必须全部驻留在 GPU 显存中。而查找表即便放在 GPU 之外也能正常工作。模型卡片中提到的“在内存受限的加速器上更具效率,比 MoE 更适合卸载(offloading)”,指的正是这一差异。
最早提出这一构想的是谷歌。去年 2 月谷歌研究团队发表的 SCONE 论文开篇就写道:“主内存和固态硬盘远比加速器内存便宜”,并建议将 N-gram 嵌入放置在加速器之外。根据该论文的成本表,系统内存约为每 GB 2 美元,固态硬盘仅为 0.1 美元。同年推出的 Gemma 3n 也采用了将分层嵌入保留在 CPU 上的做法。但将这一脉络拓展至 1,250 亿总规模、并将其中 510 亿参数置于外部的做法,据我所知尚属首次。
技术报告中也坦承了其局限性:随着 N-gram 词表规模的扩大,训练损失虽然持续下降,但下游任务的准确率在达到某一临界点后便趋于饱和。
在 100 万 token 中仅关注 2,048 个的注意力机制
Qwen3.8-Flash-Next 的层级结构。三个 GDN 与一个 QSA 构成一个模块,四个圆圈代表加宽后的残差流。(来源:Qwen)
第二项组件旨在解决长上下文的高昂开销。在全部 48 层中,有 36 层是被称为门控 DeltaNet(GDN)的线性注意力层。即便上下文变长,信息也会被压缩进固定大小的状态中,因此开销仅随长度线性增长。剩余的 12 层——即大约每四层中仅有一层——采用真正的注意力机制,并由 Qwen 稀疏注意力(QSA)负责掌管。
QSA 依靠轻量级索引器将上下文切分成若干小块并评估其重要性,每个 token 最多只精选 512 个块或 2,048 个 token 进行精细观察。即便在 100 万 token 的上下文中,每个注意力层实际关注的也仅有 2,048 个。这一思路与 DeepSeek 去年推出的 DSA 属于同一流派,但它通过压缩键(key)解决了索引器开销随长度呈平方级增长的问题。技术报告给出的数据表明,在 100 万 token 条件下,预填充5提速 7.6 倍,解码提速 4.9 倍,不过这针对的是单个注意力算子而非整个模型。
第三项组件是示意图中用四个圆圈表示的残差流6。连接各层之间的“传送带”从一条拓宽到了四条,各组件通过读取门控按需提取,再通过写入门控放回。技术报告重点强调了其稳定性:在将学习率提升至最优值 4 倍的压力测试中,旧架构频繁出现损失激增,而新架构始终保持稳定;而在正式训练中,损失突增(loss spike)一次也没有发生。
第四项是训练配方。对于矩阵权重采用 Muon,其余部分则搭配使用 AdamW;得益于重新校准扩展法则(Scaling Law)后提升了批大小与学习率,训练中取消了批大小预热(Batch Warmup)。其依据在于,批大小预热会多耗费 18.8% 的优化器步数。
九分之一与 8.6 倍究竟衡量的是什么数据
官方发布公告中称“训练成本仅为 Qwen3.7-Plus 的九分之一”,但在技术报告中的表述却有所不同。训练 FLOPs7 约为九分之一,拆解开来就是三分之一的激活参数乘以三分之一的训练 Token。以基座模型为基准,在 14 项基准测试中有 8 项领先,另外 6 项则最多落后 2.6 分。准确地说,应该是“以九分之一的 FLOPs 达到同等性能”,而非“全面超越”。由于 FLOPs 和 GPU 时间是不同的度量单位,实际训练成本是否真的降到了九分之一,报告中并未提及。
7.6 倍指的是内核速度,而公告中提到的 8.6 倍则是附带前提条件的。那是指在前缀缓存8命中率达到 90% 时,相比 Qwen3.7-Plus,Prefill 处理吞吐量可达 8.6 倍。90% 的命中率常见于反复读取相同系统提示词和工具定义的 Agent 任务。与其说是炫耀性能,这更像是一个展示该模型究竟针对何种任务而打造的数据。
被引用最多的图表当属与 Claude Opus 4.6 的对比。SWE-bench Pro 得分为 62.5 比 53.4,CoWorkBench 为 73.9 比 68.2,JobBench 为 55.7 比 36.6。然而,这一对比存在三个前提条件。首先,CoWorkBench 和 RecreationBench 是 Qwen 自行构建的基准测试。其次,SWE-bench Pro 仅对 Qwen 系列采用了“修正了问题任务的修订版”进行重新评测,而 Opus 则沿用了官方公布的数值。两者面对的并不是同一份试卷。第三,Opus 4.6 已经是两代以前的产品了。Anthropic 历经 4.7 版本后,已于 5 月 28 日推出了 4.8 版本,同夜发布的 GLM-5.3-Flash 也将对比标杆选定为了 4.8。而在人类最后的考试(HLE)中,Opus 则以 40.0 比 35.9 保持领先。
单看发布材料中列出的跑分,一个激活参数仅为 60 亿的模型能有此表现确实令人印象深刻。但如果不考虑这三个前提条件,“击败了 Opus”这一论断就无法成立。即便将所有前提都考虑在内,依然存在一个显著差距,那就是价格。正式 API 版本的 Qwen3.8-Flash 预计每 100 万 Token 的输入价格为 0.16 美元,输出为 0.47 美元。而 Opus 4.8 则分别为 5 美元和 25 美元。输入相差 31 倍,输出相差 53 倍。
同一晚发布的 GLM-5.3-Flash,价格相仿但开源许可各异
同一天晚上,另一款价格相似的模型也亮相了。同一晚由 Z.ai 推出的 GLM-5.3-Flash,输入每百万 Token 0.15 美元,输出 0.50 美元。它总参数 3,200 亿、激活参数 180 亿,从稀疏与线性混合注意力,到拓宽了残差流的 mHC,核心组件清单与 Qwen 高度重合。Z.ai 还补充道:“全部在国产 AI 芯片上运行。”这两款中国产 Flash 模型的定价基本一致,每 100 万 Token 输入约 15 美分、输出约 50 美分。在 Artificial Analysis 的独立评测中,GLM-5.3-Flash 以 57 的智能指数在同价位 173 款模型中拔得头筹,单任务成本仅为 0.09 美元。不过,在评测过程中其输出 Token 达到了 1.5 亿个,是中位数的两倍以上。即使单位 Token 价格相同,消耗更多输出 Token 的模型,最终总成本也会更高。
既然价格相似,剩下的差异就在于开源许可协议的条款了。Qwen 从本次模型开始,将开源协议由 Apache 2.0 变更为了 Qwen Community License 1.0。一个月前的 Qwen3.8-27B 采用的还是 Apache 协议。新条款提出了两项核心要求:月活跃用户超过 1 亿或月营收超过 2,000 万美元的产品,必须在界面上标明模型名称;将模型作为 API 转售的业务(模型即服务,Model as a Service),以及代码编写和办公类 AI 助手业务,在商业化使用前必须与 Qwen 单独签订协议。企业内部自用则不受此限。如果严格对照条款,前面提到的 Cursor 这类编程工具,以及为 Harvey 提供模型托管运行服务的 Fireworks 这类托管公司,都属于限制对象。请注意,这并非法律咨询意见,仅代表我个人的解读。
权重与架构固然公开,但唯独针对与自身 API 业务(QwenCloud)及自身助手产品(Qoder、QwenWork)存在竞争的两类用途,设定了单独签约门槛。我们在 7 月《开始关门的中国》一期中谈及的趋势案例,在同一晚再次上演,只是形式有所不同。这并非国家层面的出口管制,而是一家公司将与自身主营业务重叠的场景单独拎出来作为限制对象的做法。与此相反,Z.ai 在同一晚推出的 GLM-5.3-Flash 却采用了更为宽松的 MIT 许可证。同一国度之内,“收紧”与“放开”赫然分流。
HBM 瓶颈的迂回路
在上个月的“封锁催生的中国”与 8 月中旬的“沦为廉价品的智能”两期中,我曾写道 AI 的瓶颈在于 HBM,并且两篇都以韩国正扼守该关键要道作为结尾。今天的发布则为这一论点补充了一笔:当瓶颈过大时,绕开瓶颈的架构设计便会应运而生。
Qwen 仅将设计理由表述为“存在显存限制的加速器”,并未提及 HBM 或出口管制。这种关联是我的解读,但并非毫无依据。在其推荐的推理服务框架中,赫然包含了能将专家模块卸载至 CPU 内存的 KTransformers;而就在同一天夜里,Z.ai 更是明确表示该模型直接运行在中国芯片上。HBM 越是难以获取,这种设计的优势就越发凸显。
51GB 只是单台服务器内存的一小部分。真正大量消耗 HBM 的是无法通过缓存节省的输出 Token 生成,而无论是否采用这种设计,这部分需求都会持续扩大。发生改变的并非总需求量,而是需求究竟流向了哪种内存。在此之前,模型变大意味着需要更多 HBM,但在这种设计下,新增容量的一部分从 HBM 转移到了服务器 DRAM 上。这对韩国存储芯片产业而言释放出了双重信号:由瓶颈带来的议价权无法一直维系,以及迂回路最终指向的归宿仍然是 DRAM。它们出自同一批公司,只是利润率截然不同。
Oswarld视角
我在这次发布中最关注的并不是架构设计图,而是它的公开顺序。TechNode 报道的公开理由是“为了让开发者社区有机会为 Qwen4 系列做好准备”。发布仅一天,Unsloth 和 llama.cpp 就跟进了首日支持,vLLM 和 SGLang 的配方也在同一天上线。这是为了让正式版 Qwen4 面世之日,各大推理框架就已经支持了该架构。Z.ai 则以相反的方向做了同样的事。GLM-5.3-Flash 从 8 月 20 日起在 OpenRouter 上以无名的免费模型“Ox Alpha”运行了六天,接受实际调用的检验。Qwen 是先公开架构,Z.ai 则是先隐名放出模型来收集真实使用反馈。
在负责 Notion 韩国社区时,我学到了一件事:平台的扩散并不是因为功能有多好,而是当别人生态提前在上面运转时,它才会真正铺开。如果在上线前就有人做好了模板,发布当天就能直接处于有现成可用内容的状态。不公开模型和架构的实验室无法采用这种方式,因为架构本身就是商业机密。
与韩国本土的案例对比,差异就更明显了。LG 的 EXAONE 4.0 报告中,将选用滑动窗口注意力机制的理由写为“因为开源框架已广泛支持”;而在今年 1 月的 K-EXAONE 模型卡上,还附有一则提示:“在主流库提供官方支持之前,请安装我们修改的版本”。一方选择框架已经支持的架构,另一方则促使框架主动支持自己的架构。在评估自主基础模型时,如果能在基准测试旁边放上一项“发布当天能否直接跑在 vLLM 上”,不知会是怎样一番情形。
结语
总结起来有三点。第一,Qwen3.8-Flash-Next 的核心不在于性能,而在于架构设计;而该设计的核心,在于将 510 亿参数移出 GPU、转移至 CPU 内存的决策。第二,九分之一是训练 FLOPs 的对比,7.6 倍只是单个注意力内核的速度,而与 Opus 的对比表附带了三项前提条件:自研基准测试、仅 Qwen 系列采用修订版重新评测、以及与两代前的模型进行对比。即便把这些前提考虑在内,依然显著存在的差距是价格,但这个价格与同夜发布的 GLM-5.3-Flash 几乎相同,每 100 万 token 输入都在 15 美分左右,真正拉开差距的是许可证。第三,这一设计并没有推翻 HBM 瓶颈论,而是增加了一个附加条件:瓶颈越大,绕过它的架构设计就会应运而生,而这条绕行通道所使用的内存,归根结底依然是 DRAM。
本周可以尝试的一件事:打开团队正在运行的 Agent 任务日志,查看前缀缓存命中率。如果接近 90%,那么该模型瞄准的正是这类任务;如果低于 50%,那么发布公告中的 8.6 倍就与 读者 毫无关系了。
如果您在实际业务中运行长上下文 Agent,请在评论区分享您的实际缓存命中率,以及在成本构成中预填充与解码哪个比重更大。我会汇总大家的反馈,在下一期《Agent 成本的分母》中继续展开。
💬 请在评论区分享长上下文 Agent 的缓存命中率与成本结构。我会在下一期内容中予以呈现。 📨 如果有同事正在为推理基础设施苦恼,欢迎分享这篇文章。
参考资料与延伸阅读
核心来源
- Qwen Team, “On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability”, Alibaba Group, 2026.8.26. ··· 这是本文的第一手来源。“放在加速器之外的 51B”、“FLOPs 的九分之一”、“14 个中的 8 个”、学习率 4 倍压力测试全都在这里。即便只读摘要和第一章,也能把握其设计哲学。2.3 节讲的是 N-gram 嵌入。
- Qwen, “Qwen3.8-Flash-Next 模型卡”, Hugging Face, 2026.8. ··· 这里有参数构成、层排布(GDN 3 : QSA 1)、基准测试表及脚注。表下脚注 2 和 5 是正文中所述“修订版试卷”和“自研基准”的依据。
- vLLM, “Qwen3.8-Flash-Next Recipe”, 2026.8. ··· “主机内存 51GB 以上”和检查点大小写在这里。也可以确认一下内核加速数值(10.2 倍、6.6 倍)与报告中写法不同的地方。
- Qwen, “Qwen3.8-Flash-Next 官方发布”, X, 2026.8.26. ··· 正式版 Qwen3.8-Flash 预告价格(输入 0.16 美元、输出 0.47 美元)以及“缓存命中率 90% 下达 8.6 倍”的出处。
- TechNode, “Alibaba’s Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture”, 2026.8.26. ··· “为开发者社区提供备战 Qwen4 的机会”这一公开原因出自这里。
- Anthropic, “Introducing Claude Opus 4.8”, 2026.5.28. ··· 核实对比对象当前代际与价格(输入 5 美元、输出 25 美元)的出处。
- Qwen, “Qwen Community License 1.0”, 2026.8. ··· 条款仅有两段。第 1 款是模型名称标注义务(月活跃用户数达 1 亿人或月收入达 2,000 万美元),第 2 款是 Model as a Service 与 AI Work Assistant 的单独签约义务。建议亲自阅读。Qwen3.8-27B 之前一直采用 Apache 2.0。
- Z.ai, “Introducing GLM-5.3-Flash”, X, 2026.8.26. ··· 3,200 亿总参数·180 亿激活、MIT 许可证、“以 Ox Alpha 提前公开”、“全部在中国 AI 芯片上运行”、价格(输入 0.15 美元、输出 0.50 美元)的出处。
- Z.ai, “GLM-5.3-Flash 模型卡”, Hugging Face, 2026.8. ··· 稀疏·线性混合注意力与 mHC 的采用,以及对比对象为 Opus 4.8,均在此确认。推荐的四个服务框架与 Qwen 相同。
- Bloomberg, “China’s Z.ai Made Ox Alpha, Stealth Model That Rivals DeepSeek”, 2026.8.26. ··· Z.ai 首次承认 Ox Alpha 为自家模型的报道。
- Artificial Analysis, “GLM-5.3-Flash Intelligence, Performance & Price Analysis”, 2026.8. ··· 智能指数 57(同价位 173 个模型中排名第一)、每任务成本 0.09 美元、评估输出 Token 数 1.5 亿个(中位数 6,400 万)的出处。每 Token 价格与每任务成本为何不同,在这里一目了然。
- Decrypt, “AI Model Ox Alpha Is Free, Beats Claude Fable, and Nobody Knows Who Built It”, 2026.8. ··· 记录了从 8 月 20 日匿名公开到社区通过分词器锁定 GLM 的过程。还展示了基于 10 个任务的基准主张在 113 个全量运行中发生了怎样的变化。
背景知识
- Da Yu 等(Google), “Scaling Embedding Layers in Language Models”, NeurIPS, 2025. ··· 将 N-gram 嵌入置于加速器之外的设计(SCONE)的原论文。4.3 节的单价表(系统内存每 GB 约 2 美元,SSD 约 0.1 美元)即是该设计的经济学基础。
- InfoQ, “Gemma 3n Introduces Novel Techniques for Enhanced Mobile AI Inference”, 2025.7. ··· 介绍了 Gemma 3n 将逐层嵌入置于 CPU 中,从而用 40 亿内存运行 80 亿模型的技术。这是同一种构想的移动端版本。
- LG AI Research, “EXAONE 4.0 Technical Report”, arXiv, 2025. ··· 2.1 节中写明选择滑动窗口注意力的理由是“开源框架的广泛支持”。视角部分中的对比便由此而来。
- LG AI Research, “K-EXAONE-236B-A23B 模型卡”, Hugging Face, 2026.1. ··· 需求项中包含“在代码库官方支持之前请安装我们的版本”的指引。
- AlternativeTo, “Alibaba releases open-source Qwen3-Next model”, 2025.9. ··· 去年 9 月 Qwen3-Next 公开时的记录。可以从中确认这与本次是同一套剧本。
📝 术语说明
注释
-
N-gram:连续 N 个 Token 的组合。像“机器学习”这样两个 Token 构成就叫双元组(Bigram),三个就叫三元组(Trigram)。如果把经常成对出现的组合单独记下来,就能更快地理解上下文。 ↩
-
HBM(高带宽内存):堆叠在 GPU 旁边、每秒传输数太字节(TB)的内存。它比普通服务器 DRAM 快得多,也昂贵得多,目前哪怕有钱也很难买到现货。 ↩
-
预取(prefetch):提前把即将需要的数据取出的技术。就像厨师提前准备好下一道菜的食材一样,在计算完成前就从内存中开始读取,从而消除等待时间。 ↩
-
混合专家(MoE, Mixture of Experts):在模型内部放置多个小型专家网络,每个 Token 仅选用其中几个的网络结构。总参数量很大,但每个 Token 的计算量很小。不过,未被选中的专家也必须加载到 GPU 内存中。 ↩
-
预填充(prefill)与解码(decode):预填充是一次性读取并处理全部输入上下文的阶段,解码则是逐个 Token 生成回答的阶段。输入的文档越长,预填充越沉重;生成的回答越长,解码越沉重。 ↩
-
残差流(residual stream):穿透并连接层与层之间、用于传递信息的通道。每一层从该通道中取出信息进行计算,再将结果加回通道中。其工作方式类似于传送带。 ↩
-
FLOPs:浮点运算次数。它是衡量训练所需计算量的单位,但与实际的 GPU 时间或费用不同。即使 FLOPs 相同,GPU 运行的闲置率不同,账单也会截然不同。 ↩
-
前缀缓存(prefix cache):当再次收到前半部分相同的输入时,复用之前已计算好的结果的机制。在反复读取相同系统提示词和工具说明的 Agent 任务中,其命中率很高。 ↩
