商業第 58 期

經濟學家快了 5 倍。但品質呢?

真正的競爭在於「捕捉錯誤的速度」與「製造錯誤的速度」之間

經濟學家快了 5 倍。但品質呢?

引言

各位讀者,最近經濟學界出現了一幅有趣的景象。達特茅斯大學的 Paul Novosad 教授表示,多虧了 AI,他用來思考真正研究問題的時間增加了 5 倍。蘇黎世聯邦理工學院(ETH Zurich)的 Elliott Ash 教授則說,生產力的提升讓他興奮到反而更想多工作。

另一方面,經濟學社群媒體上不斷出現對 AI 生成的低品質內容——也就是所謂的「AI slop(AI 垃圾內容)」——的警告,呼籲「請停止吧」。FT 專欄作家 Tim Harford 正面處理了這兩個面向。我則想在他的分析基礎上再往前一步,指出這不僅是經濟學的問題,而是知識生產整體的結構性轉變。

AI 正在改變的三件事:生產力、範疇、驗證

Tim Harford 將 AI 可能改變經濟學的路徑歸納為三點。讓我們逐一來看。

1. 生產力——「從瑣事中解放的經濟學家」

資料清理、研究經費申請書撰寫、表格格式整理等,是吞噬經濟學家時間的典型瑣事。AI 能將這些工作大幅自動化。Novosad 教授所說的「5 倍」,並非指研究本身快了 5 倍,而是指可以思考的時間增加了 5 倍。

有趣的是,這種生產力提升尚未轉化為可見的成果。據《American Economic Review》主編 Erzo Luttmer 表示,約 25% 的投稿論文已披露使用了 AI——大多數是用於編輯或程式輔助——但投稿品質並未顯著改變。

Harford 親自利用 AI 代理工具分析了 NBER1 工作論文的摘要。ChatGPT 推出後,平均句長雖然縮短,但仍是先前趨勢的延續;反而用詞複雜度上升了。頂尖期刊的投稿數量與既有趨勢相比,也難以看出明顯變化。變快了,但沒有變好。

2. 範疇——「測量過去無法測量的事物」

比生產力更令人興奮的變化,是研究範疇的擴展。 質性資料(qualitative data)的收集成本高昂,且難以進行系統性分析。但現在,經濟學家可以透過 AI 來衡量土地使用分區規制的效果、分析艱難面試的影響,以及大規模探索企業財報以找出關稅應對模式。

預測領域的進展也值得關注。國際清算銀行(BIS)今年 3 月公開了名為 BISTRO 的宏觀經濟時間序列預測通用模型。 這個基於 Transformer 架構2 的模型,與傳統計量模型不同,無需針對特定任務進行設計。BIS 表示,該模型曾準確預測了 2021~2022 年通膨的持續性——當時大多數傳統模型機械地預測「將回歸均值」,結果大失所望。

3. 驗證——「捕捉錯誤的 AI,製造錯誤的人類」

第三種可能性最為微妙,也最為重要。AI 能否幫助篩除研究中的錯誤?

西北大學的 Ben Golub 教授共同創辦了一個名為 Refine.ink 的工具。這是一套基於 AI 的論文審查系統,能系統性地偵測數學錯誤、實證策略的漏洞以及邏輯一致性問題。據 Golub 教授表示,即使在通過頂尖期刊審查的論文中,也有至少三分之一以上存在問題。 芝加哥大學的 John Cochrane 教授將自己的通膨研究書放入 Refine 測試後,評價這是「40 年學術生涯中收到的最高水準的意見」。

經濟學五大期刊中已有數家開始試行導入 Refine。特別是在條件性接受發表前的最終檢查階段,使用最為自然——提前捕捉作者可能在出版後感到尷尬的錯誤。(類似服務有很多。其中我使用過的,推薦由韓國人開發的 https://jenni.ai/ 這個服務。)

真正的問題:速度的軍備競賽

看到這裡,AI 對經濟學來說似乎是相當正面的消息。但 Harford 提出了核心問題:

「AI 找到錯誤的速度,能否快過人類放棄尋找錯誤的速度?」

這不是單純的修辭學問題。分析 ICLR 2025(國際機器學習會議)收到的 7 萬份審查報告後,估計約 21% 從頭到尾都是由 AI 撰寫的。 這意味著不是 AI 輔助編輯,而是五份審查報告中就有一份完全由 LLM 生成。經濟學期刊中已經開始流傳「令人尷尬的草率 AI 審查報告」被提交的說法。

問題的結構可以這樣整理:

  • 學術論文每年在全球湧現超過 500 萬篇
  • 合格的審查者池無法跟上這個速度
  • 同儕審查(peer review)是一項報酬低、激勵弱的工作
  • 在這種情況下,當 AI 說「讓我來吧」,原本動機就不強的人類審查者就更沒有理由更努力了 這就是經濟學中所說的典型道德風險(moral hazard)3 結構。有了安全網,人們反而會更冒險——就像有了氣囊就超速駕駛一樣。

奧茲的視角

生產力工具直接提升產出品質的情況,其實比想像中少得多。Excel 出現時,我們期待會有更好的分析,但實際增加的只是「更多的試算表」。就像很難說 PowerPoint 提升了簡報品質一樣。

我覺得 AI 也走著同樣的路徑。生產力工具讓原本就做得好的人做得更好,但也讓原本就馬虎的人更大量地馬虎。Golub 教授自己也承認了這一點——他甚至在論文中經歷了「AI 撰寫的段落混入其中,看起來像是真正的工作」的情況。

我關注的是,像 Refine 這樣的工具能否超越單純的「錯誤偵測器」,成為學術品質的新基準線(baseline)。如果所有論文在提交前都要經過 AI 審查,人類審查者就能專注於 AI 捕捉不到的部分——原創性、理論貢獻、脈絡判斷。這可以不是威脅,而是分工的重新設計。

但問題在於,在過渡期必須承受「slop 的洪水」。我們現在正處於這場洪水的正中央。必須在傾瀉而下的 AI 內容洪流中存活下來……無論是短影音、部落格文章還是論文,都是如此。

結語

AI 正在減少經濟學家的瑣事、擴展研究範疇、並協助捕捉錯誤。但目前「更多研究」轉化為「更好研究」的證據仍然薄弱。 而且存在一個諷刺:捕捉錯誤的 AI 與更快大量製造錯誤的 AI,是同一項技術。

這不僅是經濟學的問題。程式碼審查、法律文件審閱、醫療診斷輔助——在所有 AI 承擔驗證角色的領域,都會反覆出現同樣的問題:有了安全網,人是會更謹慎,還是更粗心?

如果想深入了解這個主題,我推薦直接看看 BIS 的 BISTRO 模型論文,以及 Refine.ink 等服務。特別是 Refine 有免費試用版,只要把自己的文章或報告放進去,就能親身體驗 AI 驗證的水準。

參考資料 & 延伸閱讀

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. NBER(National Bureau of Economic Research):美國最具代表性的經濟學研究機構。此處發行的「工作論文」是正式出版前的論文,是展示經濟學界最新研究動態最快的窗口。

  2. Transformer 架構(Transformer Architecture):ChatGPT 等大型語言模型的基礎神經網路結構。以「預測下一個詞」的方式運作,BIS 將此應用於宏觀經濟時間序列資料。

  3. 道德風險(Moral Hazard):經濟學中用來描述「投保後反而更冒險」的現象。AI 幫忙捕捉錯誤,人類審查者因此不再那麼仔細,也是同樣的結構。