阿里巴巴置於 GPU 之外的 51B 參數
捨棄 HBM 改置於 CPU 記憶體的查找表,Qwen4 的成本架構設計
前言
讀者 您好,週三深夜午夜(韓國時間),阿里巴巴 Qwen 團隊開放了 Qwen3.8-Flash-Next 的權重。這不是一款成熟的旗艦模型,而是為了將應用於下一代 Qwen4 的架構設計先行公開以接受驗證的模型。總參數為 1,250 億,但處理單一權杖時實際運作的僅有 60 億,並在此之上附加了預先記憶常見權杖組合的 510 億 N-gram1 記憶體。
規格表中最吸引我目光的並非性能數據,而是那 510 億參數並非駐留在 GPU 內,而是位於伺服器的一般記憶體中這一行說明。我曾兩度撰文指出「AI 真正的瓶頸不是運算晶片,而是 HBM」2。如今出現了試圖透過架構設計而非晶片本身來繞過此瓶頸的嘗試。
開門見山地說,這次發布的本質不是性能,而是成本結構的重新設計。參數所在的記憶體層級往下移了一階,各項數據必須帶上分母來解讀,而同一個夜晚推出的兩款 Flash 模型,分水嶺不在於價格,而是在於授權條款。
510 億為何在 GPU 之外
語言模型在處理每個權杖時,都是從詞典中取出一個向量開始。Qwen 在此基礎上額外附加了一本詞典。這是一個擁有 2,000 萬個欄位、以緊接在前的兩三個權杖組合為鍵值(key)的表格。系統將最後幾個權杖進行雜湊以產生位址,從表格中取出向量並混入第二層的表徵中。由於這屬於讀取而非乘法,每個權杖的運算量幾乎沒有增加。
核心關鍵在於這個表格究竟放在何處。由於位址是確定性的,只要知道權杖就能確定要讀取的欄位,在 GPU 計算第一層的同時,便能預先從 CPU 記憶體中載入。這種預先擷取(Prefetch)3與第一層的運算重疊進行,從而掩蓋了傳輸延遲。vLLM 的部署設定指引中便體現了這個結果:GPU 端的 FP8 檢查點維持 172.78GiB 不變,額外增加了一行「用於 N-gram 卸載的主機記憶體需 51GB 以上」。
若與混合專家模型(MoE)4相比,其意義更為顯著。MoE 雖然也減少了每個權杖的運算量,但 512 個專家必須全部留在 GPU 記憶體中。查找表則可以移至外部。模型卡片中所述的「對記憶體受限的加速器更具效率,比 MoE 更適合卸載」,指的正是這個差異。
這項技術的源頭不在中國,而是在 Google。去年 2 月 Google 研究團隊發表的 SCONE 論文,開篇第一句便是「主記憶體與 SSD 遠比加速器記憶體便宜」,並提議將 N-gram 嵌入置於加速器之外。根據該論文的單價表,系統記憶體每 GB 約為 2 美元,SSD 則為 0.1 美元。同年 Gemma 3n 也採用了將各層嵌入置於 CPU 的做法。然而,據我所知,將這一脈絡應用於 1,250 億規模並配置高達 510 億大小的設計,這還是第一次。
技術報告中也自行指出了其局限性。增大 N-gram 詞彙量雖然能讓訓練損失持續下降,但下游任務的準確度在達到某個臨界點後便會趨於飽和。
100 萬權杖中僅檢視 2,048 個的注意力機制
Qwen3.8-Flash-Next 的層結構。三個 GDN 與一個 QSA 組成一個區塊,四個圓圈代表拓寬後的殘差串流。(來源:Qwen)
第二個組件鎖定的是長上下文的成本問題。在 48 個層中,有 36 個是稱為門控 DeltaNet(GDN)的線性注意力層。即使上下文拉長,也會壓縮至單一固定大小的狀態中,因此成本僅隨長度呈線性增長。其餘 12 個層——約每四層才配置一層真正的注意力機制,並由 Qwen 稀疏注意力(QSA)坐鎮。
QSA 透過輕量索引器將上下文切分為小區塊並評估重要性,每個權杖最多僅精確檢視挑選出的 512 個區塊或 2,048 個權杖。即使在 100 萬權杖的上下文中,每個注意力層實際檢視的也只有 2,048 個。這與 DeepSeek 去年推出的 DSA 屬於同一個流派,但透過壓縮鍵值(Key)解決了索引器成本隨長度呈平方級增長的問題。報告中的數據顯示,在 100 萬權杖基準下,預填(Prefill)5速度提升 7.6 倍,解碼(Decode)速度提升 4.9 倍,不過這指的是單一注意力核心(Kernel)的速度,而非整個模型。
第三個組件是架構圖中以四個圓圈表示的殘差串流(Residual Stream)6。連接各層之間的傳送帶由一條拓寬為四條,各組件透過讀取門控僅取出所需部分使用,並透過寫入門控放回。報告所強調的重點在於穩定性。在提高至最佳學習率 4 倍的壓力測試中,舊架構的損失經常劇烈跳動,而新架構則保持穩定;在正式訓練過程中,更是一次都沒有出現損失尖峰(Loss Spike)。
第四個則是訓練配方。矩陣權重採用 Muon,其餘部分則分開使用 AdamW,並重新調整縮放法則以提高批次大小與學習率,從而取消了批次預熱(Warmup)。其依據在於預熱過程會多消耗 18.8% 的優化器步數。
九分之一的分母
官方發表聲明中提到「訓練成本僅為 Qwen3.7-Plus 的九分之一」,但報告中的措辭卻有所不同。訓練 FLOPs7 約為九分之一,拆解來看是三分之一的活躍參數乘上三分之一的訓練 Token。以基礎模型為準,在 14 項基準測試中有 8 項領先,另外 6 項則最多落後 2.6 分。若要精確描述,應當是「以九分之一的 FLOPs 達成同等效能」,而非「全面超越」。由於 FLOPs 和 GPU 時間是不同的單位,實際帳單是否真為九分之一,報告中並未提及。
7.6 倍指的是核心(Kernel)速度,而發表聲明中提到的 8.6 倍則附帶了條件:在前綴快取(Prefix Cache)8 命中率達到 90% 時,相較於 Qwen3.7-Plus 的 Prefill 處理量達 8.6 倍。90% 的命中率意味著重複讀取數十次相同系統提示詞與工具定義的 Agent 任務。與其說是在炫耀效能,不如說更像是坦承這款模型究竟是為了什麼任務而打造的。
最常被引用的圖表是與 Claude Opus 4.6 的對比:SWE-bench Pro 為 62.5 對 53.4、CoWorkBench 為 73.9 對 68.2、JobBench 為 55.7 對 36.6。不過底下附帶了三行註腳。第一,CoWorkBench 和 RecreationBench 是 Qwen 自行制定的基準測試。第二,在 SWE-bench Pro 上,只有 Qwen 系列採用了「修正有瑕疵題目的修訂版」重新測量,而 Opus 則是直接沿用官方公布數據。兩者用的並非同一份試卷。第三,Opus 4.6 是前兩代的作品。Anthropic 歷經 4.7 後已於 5 月 28 日推出 4.8,同晚發布的 GLM-5.3-Flash 便是以 4.8 作為對比對象。而在人類最後的考試(HLE)中,Opus 則以 40.0 對 35.9 保持領先。
這些數字全部屬實,以 60 億活躍參數取得這樣的成績確實令人驚嘆。然而,「擊敗了 Opus」這句話,一旦拿掉那三行註腳便無法成立。即便加上註腳,留下來的數字依然是價格。正式 API 版本的 Qwen3.8-Flash 預告定價為每 100 萬 Token 輸入 0.16 美元、輸出 0.47 美元;Opus 4.8 則是 5 美元與 25 美元。輸入相差 31 倍,輸出相差 53 倍。
同一個夜晚,同一個價格,不同的鎖
這個價格並非孤例。就在同一個夜晚,Z.ai 推出的 GLM-5.3-Flash 輸入價格為 0.15 美元,輸出價格為 0.50 美元。總參數 3,200 億中啟動 180 億,從稀疏與線性混合注意力機制,到拓寬殘差流的 mHC,零組件清單與 Qwen 高度重疊。Z.ai 還補充表示「全部都在中國 AI 晶片上運行」。中國產 Flash 的價格在 15 美分與 50 美分上下交會。在 Artificial Analysis 的獨立評測中,GLM-5.3-Flash 的智慧指數為 57,在同價位 173 款模型中名列第一,每項任務成本為 0.09 美元。不過評測期間輸出的 Token 數達 1 億 5,000 萬個,是中位數的兩倍以上。即使每 Token 單價相同,話多的一方帳單依然會更貴。
當價格交會,剩下的差異就在於條款。Qwen 從這款模型開始,將授權條款從 Apache 2.0 改為 Qwen Community License 1.0。直到一個月前的 Qwen3.8-27B 都還是 Apache 授權。新條款的要求有兩項:月活躍使用者超過 1 億人或月營收超過 2,000 萬美元的產品,必須在畫面上標示模型名稱;而將模型轉售為 API 的業務(Model as a Service),以及程式設計與辦公用 AI 助理業務,在商業使用前必須與 Qwen 另行簽訂合約。內部使用則屬例外。若按條款字面解讀,昨天那篇提到的 Cursor 等程式設計工具,或是為 Harvey 運行模型的 Fireworks 等託管公司,都屬於規範對象。這是我的解讀,並非法律諮詢意見。
設計藍圖雖然公開,卻唯獨鎖上了與自家 API 業務(QwenCloud)及自家助理產品(Qoder、QwenWork)產生衝突的兩項業務。7 月「開始鎖門的中國」那篇的實質證據偏偏在這一晚浮現,只是形式有所不同。這不是國境上的出口管制,而是公司門口的旋轉門;而隔壁的 Z.ai 卻在同一晚採用 MIT 授權把門開得更大。鎖門的一方與開門的一方,在同一個國家之內走向了分歧。
HBM 瓶頸的繞行路徑
在上個月的「封鎖催生的中國」篇與 8 月中旬的「淪為賤價的智慧」篇中,我寫道 AI 的瓶頸是 HBM,而這兩篇最後都以韓國正扼守在這條關鍵要道上的故事作結。今天的發表則為這個論點添上了一筆註腳:瓶頸必然會引來繞道。
Qwen 在說明設計理由時,僅寫了「記憶體受限的加速器」,完全未提及 HBM 或出口管制。這樣的連結出自我個人的解讀,但並非毫無依據。在官方推薦的服務框架中,包含了能將專家模型移至 CPU 記憶體的 KTransformers;而在同一個晚上,Z.ai 更直接表明是在中國晶片上運行。HBM 越是稀缺,這種設計就顯得越誘人。
51GB 只不過是一台伺服器 RAM 的一小部分。實打實消耗 HBM 的,是無法透過快取節省的輸出 Token,而那股趨勢與這種設計無關,只會持續擴大。改變的並非需求量,而是方向。以往模型規模擴大,意味著需要更多的 HBM;但在這種設計下,部分容量的增長卻無需經過 HBM。這對韓國記憶體產業發出了雙重訊號:瓶頸所帶來的槓桿並非永恆不變,以及繞道所通往的終點,最終依然是 DRAM。兩者是由相同公司製造、利潤率卻大不相同的產品。
Oswarld觀點
我在這次發表中最關注的不是設計架構圖,而是公開的先後順序。TechNode 報導的公開理由是「為了讓開發者社群有機會為 Qwen4 系列產品預作準備」。發表才過一天,Unsloth 與 llama.cpp 就立刻跟進了 Day 0 支援,vLLM 和 SGLang 的實作配方也在同一天釋出。這是在確保正式版 Qwen4 登場的那一天,推論技術棧早已能順暢運行該架構。Z.ai 則是用相反的方向做了同一件事。GLM-5.3-Flash 自 8 月 20 日起在 OpenRouter 上以無名免費模型「Ox Alpha」運行了六天,接受了真實使用情境的檢驗。一方是先公開設計圖,另一方則是先把模型釋出試水溫。
我在負責 Notion 韓國社群時學到了一件事。平台之所以能傳播開來,不是因為功能有多好,而是因為其他人已經預先在上面展開行動。如果正式發布前就有人在製作範本,那麼發布日就不再是起點,而是收穫之日。封閉的研究所寫不出這樣的劇本。因為設計圖本身就是商業機密。
若與韓國對比,差異格外鮮明。LG 的 EXAONE 4.0 報告中,將選擇滑動視窗注意力(Sliding Window Attention)的理由寫作「因為開源框架廣泛支援」;而今年 1 月的 K-EXAONE 模型卡上,則附上了「在函式庫正式支援之前,請安裝我們的版本」的說明。一方是選擇框架支援的架構,另一方則是讓框架來支援自己的架構。在評估自主研發的基礎模型時,如果在基準測試旁加上「發表當天能否在 vLLM 上運行」這項指標,不知道會如何?
結語
總結來說有三點。第一,Qwen3.8-Flash-Next 的核心不在於效能,而在於架構設計;而這項設計的核心,是將 510 億參數移出 GPU、放到 CPU 記憶體的決定。第二,9 分之 1 是 FLOPs,7.6 倍是 Kernel,Opus 比較表底下還附了三行註腳。即使去掉註腳,留下來的依然是價格,而這個價格在同一個夜晚與 GLM-5.3-Flash 在 15 美分的價位正面交鋒,分歧之處則是授權條款。第三,這項設計並非對 HBM 瓶頸論點的反駁,而是一記註腳。瓶頸催生了旁路,而這條旁路最終依然通向 DRAM。
這週可以嘗試的一件事:打開組織內部運作的 Agent 任務日誌,確認前綴快取命中率。如果接近 90%,那麼這款模型瞄準的正是這類任務;如果低於 50%,那麼發表聲明中的 8.6 倍就與 讀者 您無關了。
若您正在實務中運作長上下文 Agent,歡迎在留言區分享實際的快取命中率是多少、成本中又以 Prefill 還是 Decode 的負擔更重。我們將彙整大家的經驗,在下一期「Agent 成本的分母」專題中繼續探討。
💬 歡迎在留言區分享長上下文 Agent 的快取命中率與成本結構。我們將在下一期深入探討。 📨 若您身邊有正在為推論基礎設施苦惱的同事,歡迎分享這篇文章。
📎 參考資料與延伸閱讀
核心來源
- Qwen Team, “On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability”, Alibaba Group, 2026.8.26. ··· 今日文章的第一手來源。「置於加速器外的 51B」、「FLOPs 降至 9 分之 1」、「14 個中的 8 個」、學習率 4 倍壓力測試全都在這裡。光讀摘要和第 1 章就能掌握設計哲學。第 2.3 節為 N-gram 嵌入。
- Qwen, “Qwen3.8-Flash-Next 模型卡”, Hugging Face, 2026.8. ··· 包含參數配置、層配置(GDN 3 : QSA 1)、基準測試表與註腳。表下方的註腳 2 與註腳 5,是正文中所提「修訂版試卷」與「自訂基準測試」的根據。
- vLLM, “Qwen3.8-Flash-Next Recipe”, 2026.8. ··· 「主機記憶體 51GB 以上」與 Checkpoint 大小皆記載於此。亦可確認 Kernel 加速數值(10.2 倍、6.6 倍)與報告中的記載有所不同。
- Qwen, “Qwen3.8-Flash-Next 官方發表”, X, 2026.8.26. ··· 正式版 Qwen3.8-Flash 的預告價格(輸入 0.16 美元、輸出 0.47 美元)與「快取命中率 90% 下達 8.6 倍」的出處。
- TechNode, “Alibaba’s Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture”, 2026.8.26. ··· 開源原因「讓開發者社群為 Qwen4 做好準備」的出處。
- Anthropic, “Introducing Claude Opus 4.8”, 2026.5.28. ··· 確認比較對象的當前世代與價格(輸入 5 美元、輸出 25 美元)的出處。
- Qwen, “Qwen Community License 1.0”, 2026.8. ··· 條文僅有兩段。第 1 條為模型名稱標示義務(月活躍使用者 1 億人或月營收 2,000 萬美元),第 2 條為 Model as a Service 與 AI Work Assistant 的另行簽約義務。建議親自閱讀。Qwen3.8-27B 之前皆為 Apache 2.0。
- Z.ai, “Introducing GLM-5.3-Flash”, X, 2026.8.26. ··· 3,200 億總參數、180 億啟用參數、MIT 授權、「以 Ox Alpha 形式預先公開」、「全數在中國 AI 晶片上運作」、價格(輸入 0.15 美元、輸出 0.50 美元)的出處。
- Z.ai, “GLM-5.3-Flash 模型卡”, Hugging Face, 2026.8. ··· 稀疏與線性混合注意力、採用 mHC,以及比較對象為 Opus 4.8 等資訊皆在此確認。推薦的四個 Serving 框架與 Qwen 相同。
- Bloomberg, “China’s Z.ai Made Ox Alpha, Stealth Model That Rivals DeepSeek”, 2026.8.26. ··· Z.ai 首次承認 Ox Alpha 為自家模型的報導。
- Artificial Analysis, “GLM-5.3-Flash Intelligence, Performance & Price Analysis”, 2026.8. ··· 智慧指數 57(同價位 173 個模型中排名第 1)、單項任務成本 0.09 美元、評估輸出 Token 數 1 億 5,000 萬個(中位數 6,400 萬)的出處。從中可以看出每 Token 價格與每任務成本為何有所不同。
- Decrypt, “AI Model Ox Alpha Is Free, Beats Claude Fable, and Nobody Knows Who Built It”, 2026.8. ··· 記錄了從 8 月 20 日匿名公開到社群透過 Tokenizer 指向 GLM 的過程。亦包含以 10 項任務為基準的跑分主張在完整執行 113 項任務後如何出現變化的內容。
背景知識
- Da Yu 等 (Google), “Scaling Embedding Layers in Language Models”, NeurIPS, 2025. ··· 將 N-gram 嵌入置於加速器外的架構設計(SCONE)之原始論文。第 4.3 節的單價表(系統記憶體每 GB 約 2 美元、SSD 約 0.1 美元)正是這項架構設計的經濟學基礎。
- InfoQ, “Gemma 3n Introduces Novel Techniques for Enhanced Mobile AI Inference”, 2025.7. ··· 介紹 Gemma 3n 如何將各層嵌入置於 CPU,進而以 40 億參數的記憶體需求運作 80 億參數模型。這是相同構想在行動裝置上的版本。
- LG AI Research, “EXAONE 4.0 Technical Report”, arXiv, 2025. ··· 第 2.1 節中載明選擇滑動視窗注意力的理由為「開源框架的廣泛支援」。觀點章節中的對比即源自於此。
- LG AI Research, “K-EXAONE-236B-A23B 模型卡”, Hugging Face, 2026.1. ··· 需求項目中註明「在函式庫正式支援前,請安裝我們的版本」之指引。
- AlternativeTo, “Alibaba releases open-source Qwen3-Next model”, 2025.9. ··· 去年 9 月 Qwen3-Next 公開當時的紀錄。您可以確認這與本次採用了相同的劇本。
📝 術語說明
각주
-
N-gram:連續的 N 個 Token 組合。像「機器學習」這樣兩個詞組成稱為 Bigram,三個詞組成稱為 Trigram。將經常一起出現的組合單獨記住,就能更快理解上下文。 ↩
-
HBM(高頻寬記憶體):堆疊在 GPU 正旁邊、每秒可傳輸數 TB 資料的記憶體。比一般伺服器 DRAM 快得多且昂貴得多,是目前即使有資金也難以取得足夠供貨的零組件。 ↩
-
預先擷取(prefetch):提前將即將需要的資料載入就緒的技術。就像廚師預先取出下一道菜的食材一樣,在運算結束前就開始從記憶體讀取,藉此消除等待時間。 ↩
-
混合專家(MoE, Mixture of Experts):在模型內部設置多個小型專家網路,並針對每個 Token 僅挑選其中少數幾個使用的架構。整體參數龐大,但每個 Token 的運算量較小。不過,未被選中的專家也必須載入於 GPU 記憶體中。 ↩
-
預先填入(prefill)與解碼(decode):Prefill 是一次性讀入完整輸入上下文的階段;Decode 則是一次產生一個 Token 答案的階段。輸入的文件越長,Prefill 的負擔越重;產生的答案越長,Decode 的負擔越重。 ↩
-
殘差串流(residual stream):貫穿各層、用以傳遞資訊的通道。各層從此通道中取出資訊進行運算,再將結果加總回傳。性質接近輸送帶。 ↩
-
FLOPs:浮點運算次數。用來計算訓練所需運算量的單位,但與實際的 GPU 時間或成本不同。即使 FLOPs 相同,GPU 稼動率的高低也會導致帳單金額有所差異。 ↩
-
前綴快取(prefix cache):當再次收到前半部相同的輸入時,重複利用先前已運算結果的機制。在每次都需要重新讀取相同系統提示詞與工具說明的 Agent 任務中,其命中率特別高。 ↩


