可以下載,只是跑不起來而已
2.8 兆參數 Kimi K3 與「開放」的重新計算

前言
讀者 您好,上個月 7 月 17 日,北京的 Moonshot AI 公開了 Kimi K3。參數 2.8 兆個,號稱世界最大的開放權重1模型。現在在 Hugging Face 上任何人都可以下載。按鈕按得下去。問題在於接下來的事。光權重檔案就超過 1.5 TB 的這個模型,個人電腦不用說,連一般公司的伺服器都找不到辦法跑起來。
先說結論:如今前沿級開放模型的「開放」,已經不是過去那種開放了。下載的自由給予了所有人,但執行的能力只剩下雲端、企業和國家才有。門是開了,但門檻變成了山。今天我們用數字來重新丈量這個落差。
兩週內重新繪製的地圖
先看格局。根據基準測試機構 Artificial Analysis 的智能指數,開放權重第一梯隊目前是 Kimi K3(57 分)、GLM-5.2(51 分)、DeepSeek V4 Flash(50 分)。第四和第五名也是 Kimi 的低配版本和 MiniMax。前五位全是中國模型。
這份排行榜是過去兩週之間被重寫的。7 月 17 日 Moonshot 推出 Kimi K3,兩天後阿里巴巴預覽了 2.4 兆參數的 Qwen3.8-Max,並自評「只輸給 Fable 5」。期間 OpenAI 將主力模型價格下調了 80%,7 月 31 日 DeepSeek 推出 V4 Flash 正式版,8 月 3 日阿里巴巴推出 Qwen3.8-Max 正式版。權重預計下週公開。
不只是性能提升了,體型也變大了。GLM-5.2 是 7530 億個,DeepSeek V4-Pro 是 1.6 兆個,Qwen3.8-Max 是 2.4 兆個,Kimi K3 是 2.8 兆個。變大的原因很明確——這是追趕前沿的代價。DeepSeek V4 Flash 的 50 分與 OpenAI 最新封閉模型只差 1 分,Kimi K3 則直接標榜 Fable·Sol 級的智能。要拿到頂端最後那幾分,就需要這麼大的體型。而之所以能變得這麼大,是因為如今大型模型全部採用專家混合(MoE)2架構。處理一個 token 時只喚醒其中一部分來使用。Qwen3.8-Max 在 2.4 兆個中只有 950 億個參與計算,DeepSeek V4 Flash 在 2840 億個中只有 130 億個參與計算。
這裡出現了本文的核心不對稱。**運算成本跟隨活躍參數走,但記憶體需求跟隨總參數走。**因為睡著的專家隨時可能被喚醒,所以全部都要駐留在記憶體中。所以 API 費用很便宜(DeepSeek 每 100 萬輸出 token 只要 0.28 美元),但要在本地跑就需要能容納全部 2.8 兆個的顯存。API 便宜的原因和本地跑不起來的原因,出自同一個設計。
1.5 TB 是什麼概念?消費級頂級顯示卡 RTX 5090 的記憶體是 32 GB。要插四十八張才能勉強裝下權重,而且 100 萬 token 上下文的 KV 快取3還沒算進去。再看看另一邊的增速:消費級 GPU 記憶體從 2020 年的 24 GB 到 2025 年的 32 GB,五年只增長了 33%。同一期間,開放模型的最大規模從 2024 年的 Llama 405B 到 2026 年的 2.8T,兩年內變了 7 倍。餅變大的速度遠超廚房變大的速度。
連 GPU 專業公司都拿起了鎬頭
那這個餅到底誰在吃、怎麼吃?剛好上週有一份很好的實測報告。在 AMD 晶片上提供開放模型推論服務的初創公司 Wafer,直接部署 Kimi K3 的記錄。雖然要考慮到這是 AMD 部署為業務的公司的自測,但過程寫得很具體,反而讓這部分更有價值。
先摘要數字。Kimi K3 在 NVIDIA 標準 8 卡 B200 節點(每卡 192 GB,共 1.5 TB)上,權重和 KV 快取無法同時裝下。所以要用 288 GB 的高階晶片 B300,或者把兩個 B200 節點綁在一起。但還有一顆每卡 288 GB 記憶體的晶片——AMD 的 MI355X。Wafer 的測量中,MI355X 8 卡節點每秒產出 952 token,考慮 GPU 租賃價格後的每美元吞吐量為 48 token,全面領先 B300(33 token)和 B200 雙節點配置(7 token)。模型變大導致瓶頸從運算轉移到記憶體容量時,排名就反轉了。
與一個月前的記錄對比,這個分界線就更清晰了。同一支團隊在 7 月初部署 GLM-5.2(7530 億個)時,情況不同。GLM-5.2 是 NVIDIA 單節點能裝下的規模,所以 AMD 即使做了量化4和框架手術,也只能停留在「性能 80%、價格一半」的性價比替代方案。唯一變數——模型是否超過 1.5 TB 門檻——改變了,結果就分道揚鑣了。
不過這份實測中我更關注的不是排名,而是難度。連 GPU 優化為本業的公司,第一次請求就遇到排程器崩潰的錯誤,還得用 PyTorch 手動補上缺失的函式、繞過注意力運算的形狀限制,才達到目標性能。而且他們自評這次算「比較輕鬆」——因為前幾個模型得重寫自訂核心或修兩個框架 bug。弱點也有:首次讀入 17 萬 token 的文件花了 51 秒,比 NVIDIA B300 的 23 秒慢了一倍以上。而且即使全部通過,節點租賃費也約每小時 20 美元。跑一個月的話大約 2000 萬韓元,這明確是商業數字。
當然另一邊也有。DeepSeek V4 Flash 總參數 2840 億,設計本身就小,3-bit 量化版只有 103 GB,配上 128 GB 記憶體的高階工作站就能跑。阿里巴巴也隨 Qwen3.8-Max 預覽了 270 億個的小版本。所以「能跑的開放」並沒有消失。只是那在前沿下面一個層級,而前沿本身已經脫離了個人之手——這是更準確的描述。
但免費解鎖的帳還是得算
這裡留下一個奇怪的疑問:大多數個人開發者根本跑不起的東西,為什麼大家搶著免費放出來?
華爾街的解答提供了線索。花旗在 8 月初的阿里巴巴報告中這樣總結:模型以數週為單位更新,企業因此採取「模型不可知論」策略——每項業務換不同的模型;這樣做讓單一模型的護城河變淺,競爭焦點轉向承載模型的平台和基礎設施。所以對從晶片、雲端、模型到應用全棧都有的阿里巴巴有利——這就是買入建議的邏輯。雖然要考慮 Citi 的利益相關性,但方向與阿里巴巴的行動完全吻合。權重免費放出來,同一天就把企業級代理產品 QwenWork 掛到釘釘上推出了。模型是傳單,商品是雲端和辦公工具——結構如此。
這也與上個月 DeepSeek 融資報導中引用的梁文鋒的計算相呼應:
「如果你想賺 100 倍利潤,開源會成為阻礙;但如果只取合理利潤,則毫無影響。」
所以前沿級權重公開的實際需求方,從一開始就不是個人。是把它架到自己基礎設施上賣的雲端、數據不能外流的企業、希望在本國境內保有智能的政府,以及像 Wafer 這樣把部署本身做成生意的公司。企業端的需求尤其具體。金融、醫療、國防等不能把數據送到外部 API 的行業,權重就是能放進邊界內的智能,還附带用自己的數據做微調的自由,以及模型不會某天突然被換掉的掌控感。各國政府談論的「主權 AI」材料清單最上面,也是這些公開權重。本質上,公開就是向這些玩家外包分銷的行為。
在這條分銷鏈中,還有一方在安靜地獲利。當模型的體型競爭轉化為記憶體容量競爭時,晶片的要點就不再是運算單元,而是旁邊堆疊的高頻寬記憶體(HBM)5。MI355X 的 288 GB 裝的是三星和美光的 HBM3E 12 層堆疊。在 NVIDIA 認證中長期卡關的三星從 AMD 這扇門進來了,而中國模型的膨脹正在把這扇門越撐越大。吃不到餅的人很多,但賣餅架的生意人永遠是贏家。
反方向的計算也存在
這兩週的漩渦中還夾帶了一則國內發布。7 月 27 日,Kakao 公開了第二代小型模型系列 Kanana-2。從 30 億個開始訓練,再經剪枝和蒸餾壓縮到 13 億個的配置,13 億版本直接標註為端側部署用。與 Kimi K3 並排放,規模是兩千分之一。1.5 TB 旁邊的 2.6 GB,伺服器機架旁邊的智慧型手機。
方向完全相反不是偶然,而是計算。無法參與前沿資本遊戲的公司,手中的牌是數千萬人手中已有的分銷網路,而在那個規模下,伺服器推論成本是災難。模型在裝置內跑,推論成本趨近於零,數據不出手機。這就是前面說的「邊界內智能」的零售版。設計也聚焦在節省記憶體上。
Kakao 的說明是使用了能將 KV 快取最多減少 72.7% 的注意力架構。自評中韓語知識問答以兩倍差距贏過同級 Qwen,但數學落後。與前沿不在同一級別是確定的,但從一開始目標就是摘要、分類這類生活級任務的話,算法就不同了。與其等待巨人的滲漏,不如在自己的土地上贏——這就是策略。
Oswald 的視角
做 GTM 策略顧問時,審查免費策略有一個我必定確認的項目:這張免費的帳單最終由誰、以什麼形式買單。用這個透鏡看,如今的開放權重和 Linux 時代的開源是用了同一個詞的不同東西。Linux 是下載的人就是執行的人——因為舊的 486 電腦也能跑。而前沿級開放權重是下載的人和執行的人在結構上分離的。語言是「可及性」,功能卻是「批發分銷」。
所以每次看到「開源 AI 正在民主化智能」這句話,我都建議慢一拍再下結論。被民主化的不是智能的零售市場,而是批發市場。受益者不是個人,而是接過智能再轉售的那一層。
但公平起見,反方向的事實也要記下來。滲漏確實存在。今天個人工作站能跑的級別,大約是 1 年前前沿的水平。確實會流下來。只是有延遲,而且永遠只低一個層級。承認這個延遲和層級差,在我看來才是誠實使用「開放」這個詞的方式。
結語
總結如下。
第一,開放權重第一梯隊全部是中國模型,兩週之間體型膨脹到 2.8 兆參數。
第二,MoE 架構下 API 再便宜,本地執行也需要全部參數等量的記憶體。下載的自由和執行的能力被分離了。
第三,前沿級權重公開的實際需求方不是個人,而是雲端、企業和國家;體型競爭的滲漏流向記憶體半導體。
下週阿里巴巴如果真正放出 2.4 兆個權重,我會單獨用一期來拆解那張「免費的帳單」。
讀者 您的團隊有直接跑過開放模型嗎?跑到幾 B 是現實的?在哪裡碰到牆壁轉回 API 的?歡迎在留言區分享。我會收集案例反映到下一期。
💬 歡迎在留言區分享您直接跑過開放模型的經驗。下一期會反映進去。 📨 如果有同事正在考慮自建部署,請把這篇文章轉發給他們。
📎 參考資料 & 延伸閱讀
核心來源
- Ian Ye, “Is memory the moat?”, Wafer Blog, 2026.7.31. ··· 本文的骨幹——Kimi K3 實測。核心修改過程原樣記錄在內,想知道「跑開放模型」的實際難度,從這裡讀起。
- Ian Ye, “Performance per dollar is getting faster and cheaper”, Wafer Blog, 2026.7.3. ··· 一個月前的 GLM-5.2 實測。作為本文的對照組,展示模型「裝得進」單節點時的格局。
- Artificial Analysis, “DeepSeek V4 Flash 0731 分析”, 2026.8. ··· 開放權重智能排名和價格數據的來源。
- Qwen Team, “Qwen3.8 發布”, 2026.8.3. ··· 2.4 兆參數和權重公開計劃的一手來源。
- Citi Research, “Alibaba: Qwen3.8-Max 正式發布評估”, 2026.8. ··· 「模型不可知論」框架的來源。注意這是買入建議報告,請帶保留態度閱讀。
- Kanana LLM 團隊, “Kanana-2 SLM”, Kakao Tech Blog, 2026.7.27. ··· 從 3B 壓縮到 1.3B 的過程一手來源。權重可在 Hugging Face 下載。
背景知識
- Unsloth, “DeepSeek-V4 本地部署指南”, 2026.8. ··· 實際跑 103 GB 量化版的方法。想知道「能跑的開放」目前上限在哪裡的話。
- 首爾經濟, “AMD ‘MI350X 採用三星 HBM3E’”, 2025.6. ··· MI355X 搭載韓國記憶體的背景。
搭配閱讀的往期
- 黃仁勳為什麼讚美中國模型 ··· 「免費 AI 對晶片有利」這句話的隱含假設,被本文的實測戳到了。
- DeepSeek 四小時視訊會議募了 11 兆韓元 ··· 本文引用的梁文鋒「合理利潤」計算就出自那場會議。
📝 術語說明
각주
-
開放權重(open weights):將訓練完成的模型權重檔案公開讓任何人下載的方式。比連訓練數據和代碼都開放的完整開源更窄的概念,但現在兩者常被混用。 ↩
-
專家混合(MoE, Mixture of Experts):將模型拆成多個專家模組,每個 token 只挑選需要的模組來計算的架構。省了運算,但因為不知道哪個模組會被喚起,所以全部都要駐留在記憶體中待命。 ↩
-
KV 快取(KV cache):模型讀取長文時,為了不重複計算前文而堆積在記憶體中的工作記憶。上下文越長、並發使用者越多,這部分佔比越大。 ↩
-
量化(quantization):降低權重數字的精確度以縮小檔案大小和記憶體使用的壓縮技術。用得好可以幾乎不損失性能就把容量縮到幾分之一。 ↩
-
HBM(高頻寬記憶體):垂直堆疊在 GPU 旁邊、以超高速交換數據的記憶體。AI 晶片的容量和速度實際上由這層記憶體決定,目前由三星、SK 海力士和美光三家分據市場。 ↩


