商業第 170 期

人工智慧基準測試,這樣真的沒問題嗎?

六個系統宣稱滿分,但正式評分的只有兩個

人工智慧基準測試,這樣真的沒問題嗎?

前言

7月16日,國際數學奧林匹克(IMO)在上海落幕。共有666人參賽,獲得滿分42分的學生有7位。

然而,接下來的週更熱鬧了。一週之內,六個 AI 系統相繼宣布「我們也拿到了42分滿分」。包括華為、小紅書,以及獨立測試中的四個模型。

各位讀者,這裡我想先釐清一件事。這六個系統中,真正將答卷提交給 IMO 主辦方的只有兩個。另外四個的評卷者不是人類,而是基於 Claude 的 AI 代理。而且該儲存庫自己也標明「結果強勁,但並非官方認證成績」。

先說結論。現在 AI 缺的不是更難的題目。而是記錄「誰、在什麼條件下、如何評卷」的制度化機制。所以需要的不是基準測試,而是考試。


滿分的季節,但考場卻有六處

先來整理一下到底發生了什麼。

人類這邊的成績很明確。666人中7人滿分。學生們在兩天內共計9小時解出6道題。同一天、同一時段、同一間教室。AI 這邊則分成兩條路徑。

正式評卷路徑:華為的 Celia 和小紅書的 dots-note-3.0 在人類賽事結束後取得題目,在規定時間內提交答卷,並將答卷交給 IMO 主辦方。小紅書聲明「嚴格禁止任何形式的干預」。

獨立測試路徑:另外四個來自一位研究者自行搭建的測試環境。

模型首次嘗試最終成本耗時
Claude Fable 542/4242/42約51美元2.5小時
GPT-5.6 Sol (xhigh)39/4242/42約21美元3.8小時
Kimi K336/4242/42約31美元17.4小時
AxiomProver形式化證明42/42未公開約25小時

單看數字確實令人驚嘆。Fable 5 一次就解完了,耗時不到給學生的9小時的三分之一。AxiomProver 則走的是另一條路,它用 Lean 41 這個形式化證明語言,將6道題以總計7,722行代碼寫成了機器可驗證的證明。光是第3題就用了4,229行、869分鐘。

但看著這張表,我一直在意的是成績以外的條件

벤치這四個模型的評卷者不是人類獎牌得主,而是 AI 代理。根據「努力等級」(effort tier)的設定不同,同一個模型的得分可以浮動11分。還有一個最讓人不安的細節。在同一場測試中,Meta 的 Muse Spark 和 DeepSeek V4 Pro 在第3題上給出了完全相同的錯誤答案

如果這是人類的考場,這會立即成為調查對象。因為兩份答卷以相同的方式出錯,很可能不是獨立完成的。也可能是訓練數據重疊的信號。但基準測試中根本沒有處理這種情況的程序。只是兩份都被記錄為「1道錯題」,然後就結束了。


1062年,高麗從答卷上抹去了姓名

這裡我們把時間往回拉很久。

談到考試制度,我們通常會想到題目。出了什麼題、有多難、誰答對了。但回顧考試制度的歷史,真正精心演進的部分不是題目。而是防止舞弊和驗證結果的程序

스크린샷 2026 07 27 01.33.04最具代表性的是「封彌」。將答卷右側記載的應試者身份、姓名、年齡、籍貫折起來,用膠水粘死。讓評卷者無法知道是誰寫的答卷。這制度在中國宋代確立,高麗則在1062年(文宗16年)因鄭有善的建議開始實施。並一直延續到朝鮮王朝。

但這還不是全部。遮住了名字,字跡還是可能被認出來。於是又加上了「易書」等機制,由第三方將答卷整份抄寫一遍。

千年前的人為什麼要發明這些?不是因為不信任評卷者。而是因為要讓考試結果具有社會效力,就必須能夠事後追溯結果是怎麼產生的

科舉及第不只是一分數。它是通往官職的資格。一旦賦予資格,考試就不再是測量,而是制度。成為制度的那一刻,需要的不是更難的題目,而是異議申訴程序、監考官、記錄保存,以及對結果負責的主體。

有趣的是,這種方式也用在論文評審中。所謂的「雙盲同行評審」(Blind Peer Review)就是遮去作者的學校、指導教授等背景資訊,避免評審者受到壓力或權威影響,從而客觀地評估論文。而現在,AI 評測正站在這個門檻上。


8月4日阿斯塔納,AI 首次接受監考

從這個角度來看,我對下週開始的一場活動相當感興趣。

8月2日至8日,第三屆國際人工智慧奧林匹克(IOAI)將在哈薩克阿斯塔納舉行。今年首次設立了 IOAI²: AI Model Track 這個獨立賽道。讓 AI 系統以參賽者身份報名,在與人類參賽者分開的排行榜上競技。報名截止日期就是明天,7月27日。

細讀規定,有不少有趣的細節。

  • 規定時間:8月4日和6日,各6小時,共兩場。每場3道題。
  • 禁止人類干預:首次執行提示詞之後,由系統自主完成。
  • 應試次數限制:每道題最多提交50次。
  • 標準評卷環境:執行在參賽組織的硬體上進行,但評卷在標準化 GPU 上完成。
  • 結果公開選擇權:每場結束後24小時內以非公開方式收到百分位分數,48小時內決定以組織名稱公開還是匿名。
  • 驗證條件:要獲得獎牌,必須提交包含所有模型輸入輸出、工具調用、提示詞的執行軌跡2。這些記錄不對陪審團以外的任何人公開。
  • 報名費:每個組織1個模型免費(贊助商2個),額外模型各25,000歐元。

將這份清單與基準測試對比,差異就很明顯了。

基準測試隨時可以考、不限次數、不限條件。只留下分數,不留下過程。而這個賽道有固定的考試時間、限制嘗試次數,要認證結果就必須提交過程記錄。而且還有陪審團。

如果封彌是向評卷者隱藏應試者姓名的機制,那麼提交執行軌跡就是向陪審團展示應試過程的機制。方向相反,但目的相同。讓結果可以事後驗證。

25,000歐元的報名費也不該只看作盈利模式。有報名費,意味著應試行為附帶了成本和責任。可以免費無限次重跑的評估,和付費報名在指定日期參加的考試,會讓參賽者的行為產生不同。


基準測試正在崩壞的證據

您可能會問:「但基準測試不是夠了嗎?」看近幾年的數據,答案是否定的。

第一,飽和(saturation)3。GPQA Diamond 從2023年底的39%上升到2026年初的94%。不到兩年,可用的區間就全部用盡了。AIME 2025 同樣,頂尖模型集中在80多到90多分之間。這樣一來,分數差異就不再代表實力差異。GPQA Diamond 只有198道題,在這個規模下,95%信賴區間大約是±3分。這意味著,用3分差距來排名的行銷話術,大部分在統計上沒有意義。

第二,污染(contamination)4。Scale AI 製作了與 GSM8K 難度匹配的新題組 GSM1k,用相同的模型重新測試後,部分模型最多下降了13分。而且下降幅度與該模型完整輸出 GSM8K 題目的頻率呈正相關。也就是說,不是學會了,而是背下來了。

第三,裁判問題。 用 LLM 作為評卷者時,會觀察到答案越長分數越高15~30分的偏差。也會出現因選項順序不同而偏好改變的偏差。這不是隨機噪聲,而是有方向性的偏差,一旦施加優化壓力,就會朝那個方向傾斜。

把這些加起來,結論只有一個。排行榜上的數字不是結果,而是假設。


奧斯瓦爾德的視角

我從稍微不同的角度看待這個問題。這不是評估方法論的問題,而是採購決策的問題

在制定 GTM 策略時,我無數次見過這樣的場景。供應商帶著基準測試分數過來。負責人把那個數字抄到審批單上。但兩個月後實際使用中表現不佳,沒有人能拿那個數字來追究責任。因為根本沒人知道那個分數是在什麼條件下產生的。我見過這種情況很多次,每次都得出一樣的結論。基準測試分數不是採購依據,而是行銷資產。

企業導入 AI 時真正需要的不是「我們的模型得了94分」。而是「在這些條件下、這個時間點、經過這樣的過程產生了這個結果,而且記錄保存著」。想想會計審計就明白了。我們不會盲目相信企業的財報。是因為有審計師、有審計報告、有日後可以查閱的記錄,我們才相信。

AI 性能宣稱目前還缺乏這樣的基礎設施。IOAI² 這類嘗試之所以有趣,原因就在這裡。這不是要出更難的題,而是要讓分數可以被審計的嘗試。我認為這個方向在當下更為重要。

當然,我不認為第一屆就能做到完美。在自有硬體上執行、只在標準環境中評卷的結構存在漏洞。允許50次嘗試,意味著留有只取最高分的空間。25,000歐元的報名費對資源豐富的組織更有利。但方向是對的。制度本來就是從粗糙開始,邊補漏洞邊成長的。封彌最初也只遮姓名,後來連字跡都要遮了。


結語

總結如下。

  1. 在 IMO 2026 中,人類666人裡7人滿分,AI 有六個系統宣稱滿分。其中走正式評卷路徑的只有兩個。
  2. 基準測試因為飽和、污染、裁判偏差這三個原因,正在失去區分度。
  3. 下一步不是更難的題目,而是具備應試條件和驗證程序的考試制度。8月阿斯塔納將開始第一個實驗

讀完之後,我建議您試一件事。下次有人拿著 AI 性能數字來的時候,別問分數,試著這樣問:「那個分數,誰、什麼時候、在什麼條件下評的?有記錄嗎?」 你會發現,答不上來的案例比想像中多。

如果您在實際工作中導入 AI 工具時,有過基準測試分數與實際表現不符的經驗,歡迎在留言中分享,是在哪個環節偏差最大?如果案例夠多,下一期我會整理成「實務人員的 AI 性能驗證提問清單」。


💬 歡迎在留言中分享基準測試與現實不符的時刻 · 📨 如果有同事正在評估導入 AI,請把這篇文章轉發給他們


參考資料 & 延伸閱讀

核心來源

  • IOAI, “AI Model Track: Rules and Competition Format,” International Olympiad in Artificial Intelligence 2026. 連結 ··· 執行軌跡提交和驗證分數條款是本文的核心依據。直接閱讀規定原文,「考試」與「基準測試」在設計上的差異會更加清晰。
  • Axiom Math, “AxiomProver at IMO 2026,” GitHub, 2026. 連結 ··· 6道題的 Lean 4 形式化證明全文已公開。如果想看機器可驗證的證明長什麼樣,打開第3題的檔案看看。
  • Digital Applied, “Four AIs Scored a Perfect 42/42 on IMO 2026. So What?”, 2026. 連結 ··· 以表格整理了各模型的成本、時間、重試次數和評卷主體的差異。可以區分媒體報導中混為一談的部分。
  • Acing AI, “The LLM Evaluation Crisis: Contamination, Saturation, and the Judge Problem,” 2026. 連結 ··· GPQA Diamond 信賴區間和 GSM1k 重現實驗數據出自此文。如果您處理基準測試相關工作,建議至少讀一下統計部分。
  • AFP, “AI catches up with humans to score 100% at top maths contest,” 2026年7月23日。 連結 ··· 涵蓋華為、小紅書發布的新聞社報導。也是觀察媒體如何轉述企業發布的良好案例。

背景知識

  • 「封彌」朝鮮王朝實錄專名辭典,韓國學中央研究院。 ··· 整理了1062年高麗文宗朝引入的經過。可以確認考試制度的核心不是題目而是程序。
  • 「中國科舉制度」,維基百科連結 ··· 適合快速瀏覽宋代科舉改革的整體脈絡。

安光涉(Oswarld)個人插畫

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 術語說明

각주

  1. Lean 4:一種以電腦可逐行檢查的形式撰寫數學證明的程式語言。不是由人閱讀後判斷「看起來對」,而是由機器自動偵測邏輯漏洞。

  2. 執行軌跡(execution trace):AI 在解題過程中所有輸入、輸出、工具調用、提示詞按時間順序留下的記錄。用考試來比喻,這更接近監視器錄影而非答卷。

  3. 飽和(saturation):隨著模型性能提升,評估題目變得過易,頂尖模型全部聚集在滿分附近。達到這種狀態後,分數差異無法區分實力。

  4. 污染(contamination):評估題目已經包含在模型的訓練數據中。相當於提前看到試題進考場,分數反映的是記憶而非實力。