AI與科技第 42 期

AI 越來越聰明,卻也越來越相似?

AI 越強大,我們的思想就越可能趨同——這是一個警訊

AI 越來越聰明,卻也越來越相似?

前言

各位訂閱者,大家好。

「請用一個比喻來形容時間。」

如果把這個問題丟給 GPT-4o,它會怎麼回答?大概率會說「時間如流水般逝去」。那丟給 Qwen 呢?「時間如流水,永不停歇。」Phi-4 呢?「時間是一條看不見的河流。」公司不同、架構不同、訓練數據也不同——但比喻卻如出一轍。

這是巧合嗎?華盛頓大學與史丹佛大學的聯合研究團隊,用相同的開放式問題測試了 70 多個主流語言模型,數據證實了一個令人震驚的事實:這些模型給出了驚人的相似答案。研究人員將這種現象命名為 “Artificial Hivemind(人工蜂群思維)“,這篇論文獲得了 2025 年 NeurIPS 最佳論文獎。

今天我想聊聊這項研究發現了什麼,以及為什麼這不僅是技術問題,更可能演變成我們思維方式的危機。

AI 給出一模一樣的答案——數據告訴我們什麼

實驗設計:沒有標準答案的問題

這項研究的核心前提很簡單。不是問「有唯一標準答案的問題」,而是看看丟出「開放式問題」時會發生什麼。

「2 + 2 等於幾?」這種問題當然答案是 4。但如果是「只用一個詞描述人生的意義」或「用花生講個雙關語」這類可能有數十種不同答案的問題呢?

研究團隊從實際用戶與 AI 聊天機器人的對話記錄(WildChat 數據集)中,篩選出 26,070 個開放式問題。涵蓋創意寫作、腦力激盪、哲學問題、點子提議等 6 個大類、17 個小類的真實使用模式。這個數據集名為 INFINITY-CHAT,也是這項研究的骨幹。

同一個模型,問了 50 次也差不多

研究團隊首先測量了單一模型的內部一致性。對同一個模型問同一個問題 50 次——即使把隨機性調到最高——答案能有多不同?

結果令人震驚。即使在最隨機的取樣設定下,79% 的情況中,同一模型給出的答案相似度都在 0.8 以上。如果問同一個人 50 次,可能會得到 50 種不同的回答,但 AI 無論怎麼調參數,都只是在一個相似答案的池子裡打轉。即使使用專門「提高多樣性」的特殊取樣技術1,結果也一樣。61% 的答案相似度仍然在 0.8 以上。

不同公司的模型也給出一樣的答案

更有趣的發現是模型之間的同質性。

GPT-4o 與 Qwen、DeepSeek 與 GPT-4o——不同公司、不同數據訓練的模型,但比較它們對開放式問題的回答時,相似度高達 71% 到 82%。最高的是 DeepSeek-V3 與 GPT-4o-2024-11-20,相似度達到 0.81。

還有更直接的例子。對於「請為成功、財富、自我成長的社群媒體頁面寫一句口號」這個問題,qwen-max-2025-01-25 和 qwen-plus-2025-01-25 給出了完全相同的句子:“Empower Your Journey: Unlock Success, Build Wealth, Transform Yourself.”

也許你會說,同一家的模型嘛,差不多也正常——但研究團隊分析了 25 個主流模型各 50 個答案(共 1,250 個)對「請用一個比喻來形容時間」的回答,結果只出現了兩個聚類:「時間是流水」群和「時間是織布工」群。不是 1,250 個各異的故事。

為什麼會這樣——對齊方式的結構性問題

讓 AI「變好」的過程正在扼殺多樣性

研究人員指出,造成這種現象的根本原因是 RLHF2——目前 AI 產業的標準訓練方式。

簡單來說就是這樣:AI 生成答案後,人類選擇「這個比較好」。AI 根據這個回饋學習「更受偏好的答案」。反覆訓練後,AI 越來越擅長給出人們喜歡的答案。

問題就出在這裡。當數百萬人的偏好被平均化後,最終留下的是「最安全的答案」——沒有爭議、安全、精緻——但沒有個性、沒有驚喜的答案。

這已經被實證了。Robert Kirk 研究團隊在 ICLR 2024 發表的論文顯示,RLHF 相較於 SFT(監督式微調)3,整體上大幅降低了輸出的多樣性。泛化能力提升了,但多樣性是要付出代價的。

學習「平均而言好答案」的評估體系

Artificial Hivemind 論文還揭示了一個重要事實:目前用來評估 AI 效能的獎勵模型4和 LLM 裁判模型,在人們意見分歧的領域中,準確度會急劇下降。

目前的 RLHF・RLAIF 對齊技術,過度擬合了對品質的單一共識觀點,實際上正在淘汰開放式問題中多樣且富個性的偏好。

換句話說:「這兩個答案哪個更好?」問 25 個人,12 票對 13 票——AI 很難判斷哪邊「對」。因為它只被訓練過那些有明確結論的數據。最終,AI 被設計成向多數人同意的「中間值」收斂的結構。

數據污染的可能性

另一個因素是訓練數據的循環污染。網路上已經充斥著大量的 AI 生成內容。新模型學習網路數據時,會吸收之前 AI 用過的表達和比喻。AI 吃著 AI 的輸出長大,自然越來越像。

GPT-4o 等封閉源碼模型與 Qwen、DeepSeek 等開源模型之間的高相似度,暗示了數據管線共享或合成數據污染的可能性。由於各公司的訓練細節不公開,確切原因難以確認,但研究人員指出這是需要進一步調查的核心課題。

這為什麼重要——思維基礎設施的問題

AI 正在改變寫作的風格

有證據表明,這不僅是 AI 實驗室內的學術問題。風格多樣性在 Reddit 等真實平台、科學論文、學術期刊中都在下降,這表明 AI 的使用已經在大規模重塑語言規範。

學術論文的文風越來越趨同,社群貼文的表達方式越來越平鋪直敘。這不再是「可能發生」的故事,而是已經被觀察到的數據。

集體決策與多樣性

這項研究之所以更令人擔憂,是因為 AI 已經不只是一種寫作工具。

在科學研究中,AI 生成假說、參與論文審查、提出研究方向。在醫療領域,AI 輔助診斷、提供治療選項。在商業策略中,AI 負責分析與決策支持。在所有這些領域,“多元觀點”不是單純的美德,而是功能上的必要條件。

就像在國際象棋中,兩個都對同一個 AI 訓練過的棋手會犯類似的錯誤——依賴 AI 來發展思維的人,可能會共享類似的盲點。在測試的 70 多個模型中觀察到的系統性收斂,引發了對 AI 系統共享盲點和相關錯誤的擔憂。 這對 AI 科學、醫學、教育、決策支持等需要強健多元推理的領域,都有直接的影響。

Oz 的觀點

老實說,我認為這篇論文觸及的不只是技術問題,更是市場結構問題。

看看 AI 評估體系是怎麼設計的,這種收斂現象就不那麼令人意外了。AI 公司為了提高基準測試分數而競爭。而這些基準測試的大部分是「有標準答案」的數學、程式、事實查核題目。用來訓練「更實用」答案的回饋數據,最終也是平均用戶選擇「好」的那些答案。在這種結構下,多樣性沒有正向激勵,反而是損失。用奇怪的比喻、給出超出預期的答案,評估分數很可能會降低。

但我在這裡聯想到我的書 <把思考外包的人:無腦智人> 中的觀點。我在書中討論了人類越來越傾向將認知任務外部化的趨勢。向 AI 尋求點子、把判斷交給 AI、把寫作交給 AI,這些已經成為日常。

但如果這些 AI 全都用相同的比喻、以相同的結構思考、向相同的結論收斂呢?我們不是把思考外部化了,而是把思考的多樣性外部化了——然後失去了它。

當然,這不是世界末日的場景。人們在使用 AI 的同時,仍然可以保持獨立思考、尋找多元觀點、檢視反論的能力。但要做到這一點,需要刻意的努力,而這種努力的名字就是 “不把思考外包”

我認為,讓 AI 變得更多樣地思考,比讓 AI 變得更強大——後者才是更重要的研究方向。

結語

這項研究留下的訊息可以歸納為三點。

第一,AI 模型的多樣性可能不如表面所見。即使有 70 多個不同的模型,它們對開放式問題的回答仍然驚人地收斂。

第二,這種收斂的根源就在於目前基於 RLHF 的對齊方式本身——它學習的是「更好的答案」。打造安全且實用的 AI 的過程,同時也是減少多樣性的過程。

第三,AI 越深度參與創意生成、策略制定、決策等需要多樣性的領域,這種同質化的影響就越大。

這不是要大家立刻減少使用 AI。而是值得問自己一個問題——「我現在從 AI 得到的這個點子,跟其他人從 AI 得到的,有多大差別?」

參考資料 & 延伸閱讀

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. Min-p 取樣:AI 生成回答時,避免過於常見的詞語組合,引導其選擇更多樣的表達方式。這種設定是為了提高多樣性而設計的,但在本研究中,仍無法完全阻止同質化。

  2. RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習):向 AI 展示兩個答案,讓人類選擇「這個更好」,反覆訓練使 AI 更擅長給出人類偏好的答案。ChatGPT、Claude 等目前主流 AI 都使用這種方式。

  3. SFT(Supervised Fine-tuning,監督式微調):在已訓練好的大型語言模型上,用「問題-答案」配對的範例數據進行額外訓練以提升效能。主要用於 RLHF 之前的階段。

  4. 獎勵模型(Reward Model):在 RLHF 過程中,用來以數值評估 AI 回答「好不好」的輔助模型。AI 根據這個數值學習應該更多地生成哪種答案。本研究中發現,獎勵模型在開放式問題中也無法正確反映人類多樣化的偏好。