Google 給的不是價目表,而是一張帳單
模型競爭的衡量單位,正從「token 單價」轉向「每項任務的成本」

前言
今天(當地時間 7 月 21 日),Google 發表了 Gemini 3.6 Flash。更精確地說,是 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 這三款。雖然不在定期發布的節奏內,但因為時效性很強,所以以特輯形式快速為您帶來。
價格方面,輸入 token 每百萬個 1.50 美元,輸出 token 每百萬個 7.50 美元。大多數報導都聚焦在 benchmark 分數上,但我的目光被發布稿中的另一行字吸引了。
「比前代模型少消耗 17% 的輸出 token。」
各位訂閱者,先說結論:這次發布真正的新聞不是性能。這是 AI 價格競爭的單位從「token 單價」轉向「完成同一件事需要多少 token」——也就是油耗——的信號。
發生了什麼事
Google 這次推出的是三款產品:主力模型 Gemini 3.6 Flash、超輕量的 3.5 Flash-Lite,以及安全專精的 3.5 Flash Cyber。
先看數字。3.6 Flash 的輸出單價為每百萬 token 7.50 美元,相比前代 3.5 Flash 的 9.00 美元下降了約 17%。輸入單價維持 1.50 美元不變。性能方面,在長期編碼任務 benchmark DeepSWE 上從 37% 提升到 49%,在機器學習工程 benchmark MLE-Bench 上從 49.7% 提升到 63.9%,在直接操作電腦畫面的 OSWorld-Verified 上從 78.4% 提升到 83.0%。
但 Google 在發布稿中著墨最多的不是分數,而是效率。根據 Artificial Analysis 指數1,輸出 token 消耗減少了 17%,在 DeepSWE 等部分任務上最多可減少 65%。也就是說,推理步驟和工具呼叫的次數本身就變少了。
同時推出的 3.5 Flash-Lite 也很有意思。輸入 0.30 美元、輸出 2.50 美元,每秒可產出 350 個 token,在編碼 benchmark SWE-Bench Pro 上錄得 54.2%,超越了上一代高階產品 3 Flash(49.6%)。低階產品線贏過上一代高階產品線,以下犯上的局面出現了。
發布稿末尾,Google 還順帶透露了 Gemini 4 已開始預訓練。3.5 Pro 則正在合作夥伴測試中。
為什麼是油耗而不是單價
要理解這一點,得先看 Flash 系列的價格走勢。
2025 年 6 月,Gemini 2.5 Flash 的輸入是 0.30 美元、輸出是 2.50 美元。之後 3 Flash 漲到 0.50 美元和 3.00 美元,今年 5 月的 3.5 Flash 則漲到 1.50 美元和 9.00 美元。一年之間,輸入單價翻了 5 倍。
針對這個趨勢,出現了「廉价 AI 時代終結」的解讀。根據研究機構 Epoch AI 的數據,實現同等性能的成本每年下降 5~10 倍,但供應商卻開始不再將這些節省反映在價格上。從 OpenAI 在 2025 年約 37 億美元營收中虧損 50 億美元就可以看出,此前的低價更像是搶佔市場的補貼,而現在投資者要求獲利而非成長,補貼正在被收回。
但這次 3.6 Flash 卻降了單價。看似矛盾,但這正是本次發布的核心。降單價只是枝節,主體是消耗量的減少。
在人們用聊天方式使用 AI 的時代,token 單價就是成本。問一句、答一句,就結束了。但在 agent 工作負載中,模型會自行規劃、呼叫工具、檢視結果,一路燒掉大量 token。成本產生在人類根本不會去讀的中间過程中。在這個世界裡,決定帳單的不是價目表,而是「這個模型完成一項任務要消耗多少 token」。
來算筆帳。輸出單價下降 17%,token 消耗也減少 17%,那麼每項任務的輸出成本大約降低 30%。價目表上只看到 17% 的降幅,但帳單縮減了 30%。順帶一提,100 萬個 token 大約相當於 750 張 A4 紙的文字量。產出那麼多內容,現在只要 7.50 美元。
總結來說:單價該漲的已經漲完了,接下來是動不動名目價格、而是透過油耗來調整實際價格的競爭。
三家公司站上同一個擂台
這場競爭不是 Google 一家的遊戲,這一點更重要。
以 7 月目前的同級別價目表並列來看:OpenAI 的 GPT-5.6 Luna 輸入 1 美元、輸出 6 美元,xAI 的 Grok 4.5 為 2 美元和 6 美元,Anthropic 的 Claude Sonnet 5 限時優惠價為 2 美元和 10 美元。Sonnet 5 從 9 月起將恢復正價 3 美元和 15 美元。僅僅一年前,前沿級性能在這個價位根本不存在,現在三家公司的主力產品全部擠在這個區間。
Benchmark 的優劣各有勝負。以 Google 公開的比較表為準,長期編碼任務(DeepSWE)Luna 以 67% 領先,電腦操作(OSWorld)3.6 Flash 以 83.0% 領先,知識工作評估 GDPval-AA v2 的 Elo2 分數則由 Sonnet 5 以 1607 分最高。沒有絕對的贏家。性能分不出高下,競爭的重心就不可避免地轉向價格和效率。
所以我對未來的判斷是這樣的:價目表會越來越趨同。差異化會發生在三個地方。第一是今天談到的 token 效率,第二是快取和批次處理等實際折扣機制,第三是根據任務性質在便宜模型和昂貴模型之間切換的路由3。實際上,採購方已經不再綁定特定模型,而是根據任務複雜度切換模型來消耗,這種結構正在成為標準。
奧斯瓦爾德的視角
從制定 GTM 策略、親手設計 B2B 產品價目表的經驗來看,Google 這步棋是教科書式的利潤防衛。守住名目單價,同時降低實際價格。降單價會拉低整體營收,但提升油耗則可以「選擇性地」只給「用量大的優質客戶」折扣。也就是那些大規模運行 agent 的客戶——Google 最想留住的那批客戶。
對採購方來說,啟示很明確。模型單價比較表已經很難作為參考以上了。同樣的單價,token 消耗量的不同會讓實際成本相差數倍。最終只能用自己的工作負載來衡量。 從內部常跑的幾項代表性任務中挑出幾個,每次新模型發布時都測一次「每項任務的成本」,建立這個常規流程。這比盯著價目表看要準確得多。
也有一個需要注意的地方。17% 這個效率數字是供應商挑選的 benchmark 的平均值。我在做數據工作時反覆驗證過一個規律,這類平均值在不同工作負載下偏差很大。文件摘要的効率可能大幅提升,但程式碼生成反而可能消耗更多 token,這種反轉完全可能出現。應該以自己任務的實測數據為準,而不是供應商的平均值。
結語
今天的内容用三句話總結:
Google 將 3.6 Flash 的單價降低了 17%,但真正的訊息是用少 17% 的 token 完成同樣的事。agent 時代的成本由 token 消耗量而非價目表主導,競爭的單位正在向「每項任務的成本」移動。因此,採購方需要的不是找更便宜模型的眼光,而是以自己任務為基準實測成本的常規流程。
提一個這週可以做的事:從團隊中用 AI 處理的幾項代表性任務裡挑出三四個,把目前使用的模型每項任務的成本測一次。下次換模型的決策會輕鬆很多。
如果您在實務中有過換用模型的經驗,帳單和預期不符的瞬間,歡迎在留言區分享。不管是只看價目表就換了結果嚇一跳的案例,還是因為效率而省了錢的案例,都歡迎。下一期會考慮反映進去。
💬 換用模型後帳單和預期不符的經驗,歡迎在留言區分享。下一期會考慮反映進去。 📨 如果有同事正在為 AI 成本煩惱,請分享這篇文章給他們。
參考資料 & 延伸閱讀
核心來源
- Google, “Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber”, Google Blog, 2026. 連結 ··· 本期電子報的一手來源。Benchmark 表格和價格都在這裡。
- Artificial Analysis, “Gemini 3.6 Flash: Intelligence, Performance & Price Analysis”, 2026. 連結 ··· token 效率 17% 數據的出處。比較模型間實際成本時最實用的獨立指標。
背景知識
- XDA Developers, “Google’s Gemini 3.5 Flash costs 3x the model it replaced, and the era of cheap AI is ending”, 2026. 連結 ··· 整理 Flash 系列價格走勢與「補貼時代終結」論述的文章。與本文第二章相呼應。
- 9to5Google, “Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4”, 2026. 連結 ··· 報導發布背景及 Gemini 4 預訓練消息的新聞。
- AI2Work, “GPT-5.6 vs Claude Sonnet 5: Inside the Frontier Price War”, 2026. 連結 ··· 參考了競爭對手的價格結構和限時優惠資訊。



