一個 Token 的價格所改變的一切
不是開放模型變「夠用」了,而是能使用 AI 的團隊範圍正在改變。

前言
各位訂閱者,你們聽過「開放模型」嗎?它也被稱為本機模型、本地部署模型等等……簡單來說,就是可以不用聯網、直接安裝在自己的電腦(或伺服器)上使用的 AI 模型。
上週 Google 發表了 Gemma 4。Apache 2.0 授權、31B 參數、AI 代理工具使用基準測試(τ2-bench)得分 86.4%。考慮到僅一代之前的 Gemma 3 在同一測試中只有 6.6%,這絕非漸進式改良,而是巨大的飛躍。
差不多同一時間,AI 代理框架 Deep Agents 團隊公開了他們的自評結果。GLM-5、MiniMax M2.7 等開放模型,在檔案操作、工具呼叫、指令遵循等核心代理任務上,展現出與 Claude Opus 4.6、GPT-5.4 等封閉型前沿模型相近的準確度。
但真正讓我關注的不是基準測試分數。(我已經說過好幾次了,我是基準測試懷疑論者。)我關注的是價格表。做同樣的工作,成本卻相差 10 倍到 20 倍——這不是科技新聞,而是產業結構正在改變的信號。
🔢 數字告訴我們的事:成本差距的真相
把 Deep Agents 團隊的評估數據和價格放在一起看,畫面就完全不同了。
先看代理任務準確度(Correctness)。Claude Opus 4.6 以 0.68 居首,GLM-5 以 0.64 緊隨其後。甚至比 GPT-5.4(0.61)還高。MiniMax M2.7 的 0.57 與 Gemini 3.1 Pro(0.65)的差距也不算大。
現在加上價格看看。以輸出 Token 計,Opus 4.6 每百萬 Token 25 美元,GLM-5 是 3.15 美元,MiniMax M2.7 是 1.2 美元。做同樣的工作,成本卻相差 8 倍到 20 倍。
換算成實際業務規模就更直觀了。假設你運營一個每天輸出千萬 Token 的代理系統,Opus 4.6 每天要花 250 美元,MiniMax M2.7 只要 12 美元。換算成年費,差距約 8,700 萬韓元。這個級別的差距已經不是「節省成本」的問題,而是「做不做得到」的問題。
🧩 Gemma 4 展現的新方程式
Google 在 4 月 2 日公開的 Gemma 4,為這個成本方程式又加入了一個變數——「在哪裡運行」。
從 Gemma 4 的產品線就能看出明確的意圖。E2B(2B)、E4B(4B)是為手機和瀏覽器設計的。26B MoE1在推理時僅激活 3.8B 參數,卻在 LMArena 文字測試中取得了 1,441 分。31B Dense 的規模可以跑在單張消費級 GPU 上,同時是開放模型世界第三。
特別引人注目的是代理相關性能。在 τ2-bench(AI 代理工具使用基準測試)中,Gemma 3 27B 只有 6.6%,而 Gemma 4 31B 達到了 86.4%。一代之間提升了 13 倍。它內建了原生函數呼叫2、結構化 JSON 輸出、多步驟規劃等功能,無需額外框架即可組建代理工作流。
而且這些模型採用 Apache 2.0 授權。商業使用沒有限制,也沒有月活躍用戶上限。如果你把 Gemma 4 31B 部署在自己的伺服器上運行內部代理呢?成本不再是 API 呼叫費用,而是 GPU 的電費而已。
根據 Artificial Analysis 的數據,Gemma 4 31B 的 API 呼叫成本(以 Lightning AI 為基準)每百萬 Token 僅 0.20 美元。與 Opus 4.6 的 25 美元相比,差距達 125 倍。當然性能上仍有差距,但在代理的重複性工具呼叫這類「夠好就行」的任務上,這個價格差距是決定性的。
🤖 代理時代的真正問題:Token 消耗量大
讓我再深入一步。開放模型便宜是好事,但為什麼現在這變得特別重要?
答案在於代理工作流的 Token 消耗結構。
一般聊天機器人處理一個用戶問題只需要一次 LLM 呼叫。但代理不同。處理一個用戶請求,需要經歷規劃 → 工具選擇 → 執行 → 驗證 → 自我修正,反覆進行 10 到 20 次 LLM 呼叫。 根據 Gartner 2026 年 3 月的分析,代理模型消耗的 Token 量是一般聊天機器人的 5 到 30 倍。

把一個軟體工程任務交給代理處理,包含重試和自我修正循環,會消耗 100 萬到 350 萬 Token。 如果用前沿模型來跑,一個任務就要花 5 到 8 美元。在每天處理數千個任務的生產環境中,一個月可能就要花數億韓元。
根據 FinOps Foundation 2026 年的報告,企業的平均 AI 預算從 2024 年的每年 120 萬美元飆升至 2026 年的 700 萬美元。但單個 Token 的價格卻持續下降。2024 到 2026 年間,Token 價格中位數以每年 200 倍的速度下降。
這就是矛盾所在。Token 單價在下降,但總成本卻在上升。因為代理使用的 Token 量增長速度超越了價格下降的速度。 在這種情況下,開放模型的價格優勢不只是簡單的節省,而是決定代理能否上生產環境的分水嶺。
🏗️ 價值正在流向哪裡
退後一步看這個趨勢,就能看到更大的圖景。開放模型開始在代理任務上表現出競爭力,意味著 AI 產業的價值重心正在轉移——從「誰能做出更聰明的模型」轉向 「誰能更好地整合模型」。
Deep Agents 的方法很好地說明了這一點。這個框架的設計讓你只需一行代碼就能替換模型。它也支援多模型模式——用前沿模型做規劃,用開放模型做執行。它會根據模型的上下文視窗大小自動調整壓縮策略,並將模型名稱和能力注入系統提示詞,讓代理知道自己能做什麼。

這裡的核心是 Harness(編排框架)。不是模型本身,而是包裹模型、讓它能投入實際工作的編排層3正在成為價值的中心。但別誤會,這個 Harness 也不是什麼了不起的資產。說到底,它就是把 JSON 和 Markdown 串起來,再加上權限和個別知識的客製化工具……大概就這樣。Harness 本質上是 skill.md 的進階版本。就像手機產業中,iOS 和 Android 生態系創造的價值比半導體本身更大一樣。未來類似的情況會不斷出現。
Deloitte 在 2026 年 1 月的報告中,用 「Tokenomics(Token 經濟學)」這個框架來概括這個現象。企業 AI 成本不再以訂閱費或虛擬機器來衡量,而是一種以 Token 為變動單位的新經濟體系正在開啟。在這個體系中,競爭力不是「用得起昂貴模型的資本」,而是 「從每個 Token 中榨取更多價值的架構」。
OZ 的觀點
如果你是 iPhone 用戶,請點擊 [iOS];如果是 Android 系統,請點擊 [AOS],安裝 Google 推出的 Google AI Edge Gallery,然後下載上面提到的 Gemma 4 模型試試看。容量大約 3.2GB,性能體感上大約相當於 GPT-4o。當然支援韓語,也具備圖像/語音辨識的多模態能力。這意味著什麼呢?
直到現在,AI 市場的格局都很明確:OpenAI、Anthropic、Google 製作模型,企業買 API 來用。這很像 SaaS 市場早期的樣子——擁有平台的一方掌握定價權,客戶則處於被動地位。我從 GTM 策略的角度覺得這個變化最有趣。但現在,開放模型已經跨過了一定的水準,甚至完成了最佳化。
當開放模型從「夠用」的層次跨越到「可以上生產環境」的層次時,這個格局就會動搖。企業將擁有把核心工作流遷移到自有基礎設施的選擇。Gemma 4 E2B 能在手機上運行、31B 能跑在單張消費級 GPU 上,這意味著 AI 推理的去中心化在技術上已經成為可能。
從數據角度還有一點想補充的:看這類基準測試時需要注意的地方。Deep Agents 的評估是基於 138 個測試用例。Gemma 4 的 τ2-bench 分數是特定情境(Retail)下的結果。這些數字並不能反映實際生產環境的所有複雜性。開放模型不是「與前沿模型相同」,而是 「在特定任務上具有足夠的競爭力」,這才是準確的解讀。
但方向是明確的。Token 單價下降、代理的 Token 消耗量增加、開放模型性能提升——這三個軸線交匯之處,能夠「擁有」AI 的組織範圍正在根本性地擴大。
結語
- 開放模型(GLM-5、MiniMax M2.7、Gemma 4)在代理核心任務上已達到與封閉型前沿模型競爭的水準。成本便宜 8 倍到 125 倍不等。
- 代理工作流消耗的 Token 量是一般聊天機器人的 5 到 30 倍。在這種環境下,Token 單價的差距決定的不是「節省」,而是「能否執行」。
- AI 產業的價值重心正從「製作模型的人」轉向 「善於整合模型的人」。模型正在變成可替換的零件,而編排能力才是競爭力的結構。
下次評估 AI 工具成本時,別只看模型名稱,而是以每個 Token 能產出多少價值為基準來比較。你會看到不同的風景。
感謝你今天閱讀。這是一份訂閱者專屬的電子報。
請告訴身邊的人,增加訂閱人數會成為我持續寫作的美好動力!
參考資料 & 延伸閱讀
- Langchain, “Open Models have crossed a threshold”, 2026.4.2. : 包含本電子報核心數據——開放模型 vs 前沿模型的代理基準測試結果。
- Google DeepMind, “Gemma 4: Byte for byte, the most capable open models”, 2026.4.2. : Gemma 4 官方發表部落格,包含基準測試數據和架構說明。
- Google AI for Developers, “Gemma 4 model overview”, 2026.4.2. : 整理了各模型大小的記憶體需求、量化選項和部署指南。
- Oplexa, “AI Inference Cost Crisis 2026: Why Your AI Bill Is Exploding”, 2026. : 探討推理成本佔企業 AI 預算 85% 的背景,以及代理 Token 消耗的結構。
- Deloitte Insights, “AI tokens: How to navigate AI’s new spend dynamics”, 2026.1. : 分析在 Token 經濟體系下,企業應如何管理 AI 成本的報告。
- Zylos Research, “AI Agent Cost Optimization: Token Economics and FinOps in Production”, 2026.2. : 從實務角度整理了代理工作流的 Token 消耗結構和模型路由策略。
- Hugging Face, “Welcome Gemma 4: Frontier multimodal intelligence on device”, 2026.4. : 對 Gemma 4 架構和開源生態系整合的技術分析。

각주
-
MoE(Mixture of Experts,混合專家):在 AI 模型內部設置多個「專家」網路,根據輸入只激活其中一部分的結構。雖然有 26B 參數,但實際推理時只使用 3.8B,所以既能像小模型一樣快速,又能保持大模型的性能。就像自助餐擺滿所有菜色,但客人只吃其中幾道一樣。 ↩
-
原生函數呼叫(Native Function Calling):AI 模型可以直接呼叫外部工具(API、資料庫、搜尋引擎等)的內建功能。以前需要額外的框架,現在模型本身就具備這個功能,代理的搭建變得簡單許多。 ↩
-
編排層(Orchestration Layer):連接和協調多個 AI 模型、工具、數據源的中间軟體層。就像管弦樂團的指揮協調各樂器一樣,管理哪個模型負責哪個任務、結果如何組合。Deep Agents 這類框架就扮演這個角色。 ↩


