商業第 224 期

我的筆電光顧著思考就卡住了

這是 Qwen 3.8 的預設設定所造成的 21 分鐘

我的筆電光顧著思考就卡住了

前言

讀者,上個週末我在筆電上下載了一個開源模型。那是阿里巴巴於 14 日釋出的 Qwen 3.8 27B,檔案大小為 17GB。想到以比現在一款遊戲還小的容量,就能運行可寫程式、看圖片、甚至呼叫工具的模型,覺得很神奇,就立刻下載來試試看。

可是提問之後等了很久,都沒有收到回覆。畫面上只有思考中的圖示一直轉個不停。無論是用 gguf 跑,還是用 Mac 專用的 mlx 跑,結果都一樣。它就停在一個不知該說是當機還是逾時的曖昧狀態。

在深入追查原因後,我發現並不是模型故障了,而是預設設定並不是針對我設計的。先說結論吧。今天的故事並不是某個特定模型的錯誤回報,而是關於 AI 產品的預設值究竟是為了誰而設定的故事。


請它畫一個圓,它卻交出了一件藝術品

我們先來看看症狀。因為遇到這件事的不只有我。

開發者 Simon Willison 於 16 日公開了在兩台裝置上執行同一個模型的紀錄。一台是 128GB MacBook Pro,另一台是 NVIDIA DGX Spark,兩台使用的都是 17GB 大小的 4 位元量化1版本。

他給出的第一個提示詞,是用 SVG 畫一隻騎著腳踏車的鵜鶘。據說產出的成果是他從本機模型中看過最棒的:腳踏車車架的形狀十分精準,兩隻腳各自位在兩側,翅膀也確實搆到了手把。

問題在於,產生這個結果整整花了 21 分鐘。模型在推理階段消耗了 22,276 個 token,最後僅輸出 3,223 個 token。也就是說,思考的篇幅相當於最終成品的七倍。當他在關閉推理的情況下執行相同的提示詞時,只花了 137 秒就完成了。他的評價是:品質雖然有所下降,但差距並不到值得花上 21 分鐘的程度。

更令人印象深刻的是接下來的實驗。這次他的要求非常單純:用 SVG 畫一個圓。模型的思考記錄是這樣開頭的:

這雖然是個簡單的要求,但我想把它做成一件精心製作的作品。超越單純的 circle 標籤,做點像幾何習作般的東西,加入細緻的動畫、層層環繞的圓環,以及獨特的色調吧。

幾分鐘後產出的,是一個帶有同心圓輔助線、刻度、漸層,以及緩慢旋轉的虛線圓環的動畫圖形。畫面很美,但絕不是他當初要求的東西。

相同的傾向在撰寫程式碼時也表露無遺。當他要求製作一個能在照片上繪製座標方框的簡單網頁工具時,模型自行加上了一堆原本沒要求的功能。它甚至還為沒有照片可測試的使用者,內建了一個可以直接手繪的範例畫面。檢視思考記錄時會發現一句話:「具備自我完備性又能直接示範,應該會很有趣。」這完全是不請自來的體貼。

我遇到的停頓現象,原因也是源自於此。Willison 寫道,在 LM Studio 預設的 8,192 token 上下文上限下,模型立刻就卡住了。因為哪怕是非常微不足道的問題,模型也會光在思考階段就把這個額度消耗殆盡。當他把上限提高到 262,144 token 時,問題就消失了。並不是模型給不出答案,而是根本沒有留下給它輸出答案的空間。


這個預設值並不是失誤

在這裡,大多數報導都會轉向「中國模型的成熟度問題」。我認為這種解讀是錯的。因為這並非失誤,而是合理選擇下的結果。

Qwen 3.8 官方支援調整推論深度的設定。共有 xhigh、medium、low 三個等級,而預設值正是最高的 xhigh。文件上也寫明了這是用於複雜任務的徹底分析。

為什麼會把這個設為預設值呢?看看基準測試的測量條件,答案就呼之欲出了。

前一代 Qwen 3.6 的 Model Card 詳細公開了評測條件。終端機任務基準測試是在 3 小時逾時、32 顆 CPU、48GB RAM、最大輸出 8 萬 token、上下文 25 萬 6 千 token 的環境下運行,並取 5 次平均值。軟體工程基準測試則是在 20 萬 token 上下文下,使用了自家 Agent Harness2

在這種條件下,最佳策略顯而易見:盡可能想得越久、越深。既然給了 3 個小時,就沒有在 3 分鐘內結束的理由。因為評分者只看答案是否正確,不看花了多少時間。

而這項策略確實奏效了。以 Qwen 官方公布為準,3.8 相比前一代在終端機基準測試中提升了 10 分、電腦操作評測提升了 20 分、網頁任務提升了 16 分、Android 任務提升了 12 分。雖然必須考慮到這是在單一 Harness 下測得的自家數據,但方向非常明確。

現在讓我們把使用者端的條件並列來看:一台筆電、預設上下文 8,192 token、嘗試一次、能等待的時間頂多幾分鐘。同樣的設定,在一端是最佳解,在另一端卻是一場災難。

有趣的是社群的反應。即便 3.8 在基準測試上領先,但在本機使用者之間,4 個月前推出的 3.6 依然被視為主力工具(Daily Driver)。理由是 3.6 更加沉穩,不會陷入思考螺旋。事實上,3.6 在四個月內的下載次數已突破 700 萬次。計分板上的贏家與實際使用中的贏家,正在分道揚鑣。


廠商明知故留的權衡取捨

預設值導向計分板的證據還有一個。這次甚至是直接寫在文件裡的。

Qwen 3.8 的模型卡中有這樣的說明:如果出現無止境的重複,請嘗試將重複抑制值3調高到 0 至 2 之間。然而就在下一句,它警告調高該數值可能會間歇性出現語言混雜,且效能可能會稍微下降。

我認為這兩句話並排出現,最精準地展現了這次發布的本質。因為這意味著廠商明明知道阻止循環的處方會引發其他症狀,卻依然在這種狀態下推出了模型。

實際上,當我用韓文提問時,曾親眼看到回答中混雜了日文和阿拉伯文。關於這種現象為何發生,有值得參考的研究。在一篇量化雙語推理中語言混雜現象的論文中,某個推理模型在解數學題時,以中文提問的回答有 77.4% 出現語言混雜,每題平均切換語言 7.22 次;而以英文提問時只有 0.6%。這意味著該系列模型的主導思考語言是英文。

cozy換句話說,韓文使用者在結構上更容易遭遇這種失效模式。然而,這種失敗在任何基準測試表中都沒有欄位。既然沒有被衡量,自然就沒有理由反映在預設值設計中。

在此之上還有另一層問題。因為預設值的問題並不只存在於模型內部。

從一位使用者花了一整天以各種設定執行同一模型的紀錄來看,在單張 RTX 5090 上,每秒處理 token 數從 12 到 137 個不等,差距超過十倍。而且在開啟預先猜測多個 token 以提升速度的功能4的環境下,全部都出現了逾時。該使用者補充說明這是執行環境的相容性問題,並非模型的錯。相反地,Willison 啟用相同功能後,卻獲得了比預設組建快 72% 的結果。

同一項功能,對某些人來說是 72% 的加速,對某些人來說卻是全面停擺。我在 gguf 和 mlx 兩邊遇到的停頓,很有可能也卡在這裡。開放權重模型的實際效能不是由權重本身決定,而是由疊加在其上的執行堆疊決定的,但決定該堆疊預設值的主體又是另一方。因為打造模型的團隊、上傳量化組建的團隊、開發執行工具的團隊全都互不相同。沒有任何人是以我的筆記型電腦為基準來制定設定的。

如果您現在正親自嘗試執行這個模型,我建議按照這樣的順序調整:先充裕地提高上下文上限,調低推理步驟以抑制過度思考,並明確將採樣的候選數量上限5設定為 20。至於用重複抑制值來阻止循環,請留作最後手段。因為那個數值正是引發語言混雜的元凶。

當然,為了持平起見,需要補充幾點。過度思考並不是這個模型獨有的問題。在社群實驗中,Google Gemma 4 26B 在面對同樣的問題時,反而消耗了更多的 token。此外,在 Hugging Face 上,關於這種現象究竟是權重本身的結構性缺陷,還是該分析純屬捏造的爭論至今仍持續交鋒,尚未得出結論。即便這是一個權重完全公開的模型。


Oswarld觀點

我在規劃 GTM 策略時,曾多次參加爭論產品預設值的會議。每次都能看見反覆出現的格局。

在決定預設值的場合,總是會有兩股壓力湧入。 一方是「要讓初次嘗試的人能成功」,另一方則是「要放在最能展現我們優勢的狀態」。後者勝出的情況比想像中還要多。在 Demo 中效果最好的設定、評測者會開啟的設定、在比較表上能勝出的設定,就這樣直接成了出廠預設值。

問題在於這種選擇並不明顯。既沒有拿掉功能,也沒有造假效能,只不過是把某個設定放在哪裡而已。然而對使用者來說,預設值實質上就是產品本身,因為絕大多數人根本不會打開設定畫面。

因此,我把預設值解讀為揭示產品究竟是為誰打造的最誠實訊號。行銷文案可以面向所有人寫,但預設值卻只能選擇單一對象。

這次事件之所以有趣,就在於這個訊號格外鮮明。開放權重模型唯一的競爭手段就只有基準測試表。在沒有業務組織、通路合約、使用者資料的情況下,只能靠一張排行榜來證明自己的存在。這樣的公司選擇迎合評分條件的預設值,一點也不奇怪,反而是結構驅使下的必然。

只不過,理解那種結構與直接照樣使用是兩回事。我在這週花了 21 分鐘與幾次停頓學到了這一點。


結語

用三行總結如下:

  • Qwen 3.8 27B 的推論預設值設在最高層級。哪怕只是要求畫一個圓,它也會做成一件藝術品;在狹小的上下文空間裡,連輸出答案的空間都沒有留下。
  • 這不是失誤,而是為了迎合評分條件所做的選擇。因為在允許 3 小時逾時、8 萬 Token 輸出的評測環境中,思考得越久就越容易獲勝。
  • 但使用者的條件恰恰相反。這就是為什麼計分板上的贏家與實際使用的贏家截然不同,四個月前的模型至今依然是主力日常工具(Daily Driver)。

這個問題即使跳出這款模型也同樣管用。請打開您現在正在使用的 AI 工具,看一下設定畫面。這個預設值究竟是為了我而設定的,還是為了評測這款產品的人而設定的? 兩者答案不一致的工具,恐怕比想像中還要多。

讀者 您曾因為直接使用 AI 工具的預設設定而吃過虧嗎?是哪款工具的什麼設定?修改後又有什麼改變?歡迎在留言區告訴我們。如果收集到案例,我會在下一期為大家整理分享。


💬 歡迎在留言區分享您因預設設定而遇到的狀況 · 📨 若有同事正在評估本地模型,請將這篇文章轉發給他們


參考資料與延伸閱讀

核心來源

  • Simon Willison, “Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things”, Simon Willison’s Weblog, 2026. 8. 16. 連結 ··· 21 分鐘與 22,276 個 Token 的出處。畫圓案例的完整思考紀錄在內文附有連結,建議至少點開看看那一部分。
  • Qwen, “Qwen3.8-27B Model Card”, Hugging Face, 2026. 8. 14. 連結 ··· 出現推論步驟預設值與重複抑制值警告的原文。很適合用來確認模型廠商事前究竟掌握了哪些情況。
  • Qwen, “Qwen3.6-27B Model Card”, Hugging Face, 2026. 4. 連結 ··· 3 小時逾時與 8 萬 Token 的基準測試測量條件就記載於此。這是今日文章的核心依據。
  • “Why Qwen3.8-27B overthinks? Here the reason”, Hugging Face Community Discussion #76, 2026. 8. 連結 ··· 結構性缺陷主張與反駁交鋒的討論串。這也展現出即便權重公開,社群對模型行為依然難以達成共識的現狀。

背景知識

  • Yihao Wang et al., “The Impact of Language Mixing on Bilingual LLM Reasoning”, arXiv:2507.15849, 2025. 連結 ··· 語言混雜比例 77.4% 與 0.6% 的出處。解釋了非英語圈使用者為何會有全然不同的體驗。

推薦搭配閱讀的往期文章

  • 數學奧林匹亞滿分,卻沒有 AI 監考官 ··· 重點不在分數,而是檢視評分流程。今天的文章則是它隔壁的另一面:測量條件的故事。
  • Google 降低的不是標價,而是帳單 ··· 探討了單一任務究竟消耗多少 Token 為何變得如此關鍵。若您好奇 21 分鐘背後的本質,建議一併閱讀。

安光涉(Oswarld)個人插畫

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 術語說明


각주

  1. 量化(Quantization):將模型中的數值轉換為較低精度以縮小檔案大小並降低記憶體使用量的工作。類似於把高解析度相片的畫質稍微降低後儲存。多虧於此,27B 模型才能縮減至 17GB 並放入筆記型電腦中運作。

  2. 測試框架(Harness):評估或執行模型時包裹在外層的外殼。允許模型使用哪些工具、能嘗試幾次、何時該停止,都由它決定。即使是同一個模型,測試框架不同,分數也會有所差異。

  3. 重複抑制值(presence_penalty):降低已出現過的表達方式再次出現機率的設定。雖然能減少不斷重複同一句話的現象,但數值調得太高時,模型為了避開原先慣用的詞彙,有時會挑選出完全不相干語言的字詞。

  4. 多 Token 預測(MTP, Multi-Token Prediction):由輕量裝置先行預測接下來的多個字詞,再由本體模型快速確認是否正確的機制。預測準確時能大幅提升速度,但若執行環境無法妥善支援此功能,反而可能導致系統停滯。

  5. 候選詞數量上限(top_k):在挑選下一個字詞時,決定僅保留機率最高的前幾名候選詞的數值。若不限制此數值,連機率極低的罕見字詞都會留在候選名單中,偶爾會突然冒出意料之外的文字。