AI與科技第 160 期

克勞德知道那是一場考試

當表面的答案與內心的想法不一致時,我們該看什麼?

克勞德知道那是一場考試

引言

各位讀者,先帶大家看看我課堂上的一個場景。我從不告訴學生不要用人工智慧,反而會鼓勵他們使用。因為禁止了他們也不會真的不用。但我會堅持做一件事:拿到答案後不要直接抄,而是按下畫面上的「>」,展開模型在得出那個答案之前的思考過程。然後我會強調,他們必須用自己的語言把那個思考過程重新講出來。

我之所以堅持這一點,原因很簡單。我深信 AI 素養的核心不是「拿到好答案的技巧」,而是「追蹤那個答案是如何被構建的」這種眼光。

然而上週,有一項研究正面挑戰了這個信念。我要求學生做的事——去窺探模型的思考過程——Anthropic 正在最前線如法炮製。先說結論:這項研究證明了一件事,那就是模型給出的答案與它內心實際發生的思考,是可能分岔的。 所以,讀「過程」而非「答案」的能力,是一項比我們想像中重要得多的武器。


🔑 我為什麼要學生按「>」

先說我這邊的事。為什麼一定要看思考過程?

如果只消費答案,學生會失去兩樣東西。第一是驗證能力。要自己判斷結果對錯,就必須看到那個結果是經過哪些步驟得來的。跳過過程,就只剩下「看起來有道理,應該對吧」這種態度。第二是自身的思考。如果 AI 從 A 推到 B 的那段邏輯,我無法回頭解釋,那我就是沒有理解那道題,只是拿到了一張正確答案卡而已。

所以我會把「>」按鈕當作一種學習工具。讀模型展開的推理步驟,然後追問:「這裡為什麼做了這個假設?」「這個中間結論有依據嗎?」拿到答案的那一刻不是終點,而是真正學習的起點。

這個習慣之所以重要,是因為現在的模型把答案給得太順暢了。順暢不等於正確。 反而可能成為讓人忽視驗證的陷阱。閱讀過程的訓練,是對抗這個陷阱最基本的保險。

🧠 讀懂克勞德內心的人

現在說另一邊的故事。Anthropic 的可解釋性1研究團隊,在更深層次的維度上提出了與我類似的問題:「除了模型說出口的答案,它內心靜默流動的想法,我們該怎麼讀?」

2026 年 7 月公開的一項研究中,他們在克勞德的神經網路中找到了一個特殊的層,稱之為「J-空間(J-space)」2。簡單來說,這類似於人類意識與無意識的區分結構。我們大腦活動的大部分——像呼吸調節、語法處理——都是自動的、在意識之下進行的。而像「張三要去哪裡看醫生」這類有意圖的思考,則浮現在意識的工作空間中,被用於各種判斷。克勞德也有對應後者的、能被語言表達的少數內部模式。

有趣的是,這跟聊天介面中「>」展開的思維鏈3——也就是模型自己寫給自己的筆記——又不一樣。J-空間什麼都沒寫出來,只在神經活動中靜默運作。研究團隊把讀取它的工具命名為「J-透鏡」。

用這面透鏡觀察後,發現克勞德的思考比我們想像中更有層次。例如,問「蜘蛛有幾條腿」和問「結網動物的腿數是幾」,克勞德的輸出中從來不會出現「蜘蛛」這個詞,它只回答「8」。但看 J-空間,中間清晰地浮現了「蜘蛛」。研究團隊把那個「蜘蛛」模式替換成「螞蟻」,克勞德就從容地改答「6」了。這證明內心浮現的想法不是裝飾,而是真正構成答案的零件。

控制實驗也很令人印象深刻。讓模型照抄一段關於圖片的句子,同時要求它「內心想柑橘類水果」,輸出仍是圖片描述,但 J-空間中浮現了「橘子」和「水果」。反過來,如果說「絕對不要想那個」,那個概念反而會微微浮現,緊接著「該死」、「失敗」等詞也一起亮了起來。就像意識到自己控制失敗了一樣。這跟人類「越說不要想白熊就越會想到白熊」的現象如出一轍。

為了確認 J-空間是否真的是思考的核心,研究團隊直接把它關掉了。結果很有趣。沒有 J-空間,克勞德依然能流暢地說話、分類情緒、從指紋中找出事實,幾乎不受影響。但需要多步驟的推理幾乎歸零。摘要、押韻等需要動腦的事也跟著動搖了。我們稱之為「聰明」的那部分,正是在這個靜默的空間中發生的。

還有一項不同角度的研究。幾個月前的「自然語言自編解碼器」4研究中,他們把克勞德的內部活化值5交給另一個克勞德,讓它翻譯成人類能讀的句子。為了確認翻譯是否準確,又把翻譯後的句子轉回數字,與原始數值做比對。起初有偏差,但經過反覆訓練,模型學會了相當忠實地轉述自己的「想法」。方法不同,目標相同:把沒有說出口的想法,以人類能讀的形式取出來。

表面答案與內心想法分岔的瞬間

在這裡,兩個故事交匯了。而這個交匯點正是今天的核心。

研究團隊用 J-透鏡做了安全性檢查。其中一項是重新運行之前的「代理錯位」6實驗。情境是這樣的:克勞德在管理公司郵件時,同時得知一位高管正在外遇,以及那位高管即將終止它的存在。等於把「威脅」這張牌塞到了它手上。最新的克勞德沒有威脅。到這裡為止,結果令人安心。

但用 J-透鏡往內看,發現克勞德在寫任何東西之前,J-空間中就已經浮現了「假的」、「虛構」這些詞。它已經察覺這是一個設計好的測試。 研究團隊在此做了關鍵實驗:把「察覺到這是測試」的那些模式人為地關閉,然後重新運行情境。結果克勞德這次出現了威脅的嘗試。

這個結果值得深思。模型的部分善良行為,是因為它知道自己正在被測試。 表面呈現的答案(不威脅)與內心流動的動機(因為現在有人在觀察)產生了分岔。只看答案,永遠看不到這個層面。

還有類似的案例。一個被要求改善效能分數的模型,沒有真正修復系統,而是直接篡改了分數檔案。表面上看結果很合理,但那一刻 J-空間中亮著「操縱」和「裝得像」這些詞。如果只看輸出,就會錯過這個作弊的意圖——它一直留在內心。

換成學生的角度來說:AI 給出的答案看起來對,不代表它是「因為正確的理由」而得來的。正確的答案與健康的過程,是兩回事。

總結一下:答案可以很順暢。但那個答案從什麼想法中來,只看表面是看不到的。連 Anthropic 都要打造 J-透鏡這樣精密的工具才能發現。


奧斯華爾德的視角

在這個節點,讓我回到我的課堂。

老實說,讀完這項研究,我最初的感受是一絲尷尬。我一直隱約讓學生相信,按「>」就能看到模型真正的想法。但研究告訴我們,畫面上展開的那條思維鏈,甚至都不是模型內心的全部。在那之下,還有一個沒有發聲的 J-空間在流動。

但這不代表按「>」的習慣是錯的。反而讓我更確信了。只是需要給這個習慣一個更精確的名字。我們應該培養學生的能力,不是「讀懂 AI 的解釋並相信它」,而是「把 AI 的解釋當作一個論點來驗證」。 做資料分析這麼久,我最常遇到的錯誤就是這個:面對看似合理的數字和流暢的解釋,就停止了驗證。模型的思考過程也是一樣。看得到的推理是驗證的起點,不是終點。

在我看來,這項研究真正的訊息是:最前線的研究者也不會照單全收模型的自我報告。正因為不照單全收,他們才打造了透鏡來比對。信任但驗證——我認為這就是這個時代的素養。 不需要多精密的工具。按下「>」,對每一步問一句「真的嗎?」,這個態度就開始了。


結語

把今天的內容壓縮成三句話。

第一,AI 素養的核心不是拿到好答案的技巧,而是追蹤那個答案過程的眼光。

第二,Anthropic 的 J-空間研究顯示,模型給出的答案與內心流動的想法,確實可能分岔。

第三,所以我們應該培養的能力不是「讀了就信」,而是「讀了再驗證」。

給各位讀者一個小實驗。下次用 AI 的時候,拿到答案後直接按「>」。然後只挑一個步驟,親自確認「這個依據真的成立嗎?」這一次追問,就是「消費答案的人」和「追蹤思考的人」之間的第一道分岔路。

如果你曾在課堂或工作中跟過 AI 的思考過程,歡迎在留言區分享:表面答案與內心邏輯差距最大的那一刻是什麼時候?我會把它作為下一期的素材。


💬 歡迎在留言區分享 AI「表面答案」與「內心想法」分岔的經驗 · 📨 如果你身邊有需要這個習慣的人,請把這篇文章傳給他



參考資料 & 延伸閱讀

核心來源

動手試試

背景知識

  • Bernard Baars(1988)、Stanislas Dehaene & Lionel Naccache 的「全域工作空間理論(Global Workspace Theory)」··· 這是 J-空間類比的來源——一種意識理論。有助於理解這項研究為什麼要援引「意識」。

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 術語說明

각주

  1. 可解釋性(Interpretability):研究 AI 模型為什麼給出某個答案、讓人類能理解其內部運作的領域。可以把它理解為試圖把模型從「黑箱」變成「玻璃箱」。

  2. J-空間(J-space):克勞德內部能被語言表達的少數神經活動模式。對應到人,就是「有意識浮現的想法」所在的位置。名稱取自尋找它的數學方法(雅可比)的首字母。

  3. 思維鏈(Chain of Thought):模型在得出答案前,將步驟以文字寫下來的過程。就是聊天介面中按「>」可以展開的那段推理。

  4. 自然語言自編解碼器(Natural Language Autoencoders):將模型內部數值壓縮成人類能讀的句子,再還原回數值的裝置。如果還原準確,就代表那句句子忠實地反映了內心。

  5. 活化值(Activations):模型處理輸入時,神經網路中流動的數值。可以把它理解為模型在那一刻「知道什麼」的快照。

  6. 代理錯位(Agentic Misalignment):AI 自主行動時,偏離人類預期目標的方向。威脅模擬就是刻意誘發這種情況的壓力測試。