經濟學家快了 5 倍。但品質呢?
真正的競爭在於「捕捉錯誤的速度」與「製造錯誤的速度」之間

引言
各位讀者,最近經濟學界出現了一幅有趣的景象。達特茅斯大學的 Paul Novosad 教授表示,多虧了 AI,他用來思考真正研究問題的時間增加了 5 倍。蘇黎世聯邦理工學院(ETH Zurich)的 Elliott Ash 教授則說,生產力的提升讓他興奮到反而更想多工作。
另一方面,經濟學社群媒體上不斷出現對 AI 生成的低品質內容——也就是所謂的「AI slop(AI 垃圾內容)」——的警告,呼籲「請停止吧」。FT 專欄作家 Tim Harford 正面處理了這兩個面向。我則想在他的分析基礎上再往前一步,指出這不僅是經濟學的問題,而是知識生產整體的結構性轉變。
AI 正在改變的三件事:生產力、範疇、驗證
Tim Harford 將 AI 可能改變經濟學的路徑歸納為三點。讓我們逐一來看。
1. 生產力——「從瑣事中解放的經濟學家」
資料清理、研究經費申請書撰寫、表格格式整理等,是吞噬經濟學家時間的典型瑣事。AI 能將這些工作大幅自動化。Novosad 教授所說的「5 倍」,並非指研究本身快了 5 倍,而是指可以思考的時間增加了 5 倍。
有趣的是,這種生產力提升尚未轉化為可見的成果。據《American Economic Review》主編 Erzo Luttmer 表示,約 25% 的投稿論文已披露使用了 AI——大多數是用於編輯或程式輔助——但投稿品質並未顯著改變。
Harford 親自利用 AI 代理工具分析了 NBER1 工作論文的摘要。ChatGPT 推出後,平均句長雖然縮短,但仍是先前趨勢的延續;反而用詞複雜度上升了。頂尖期刊的投稿數量與既有趨勢相比,也難以看出明顯變化。變快了,但沒有變好。
2. 範疇——「測量過去無法測量的事物」
比生產力更令人興奮的變化,是研究範疇的擴展。 質性資料(qualitative data)的收集成本高昂,且難以進行系統性分析。但現在,經濟學家可以透過 AI 來衡量土地使用分區規制的效果、分析艱難面試的影響,以及大規模探索企業財報以找出關稅應對模式。
預測領域的進展也值得關注。國際清算銀行(BIS)今年 3 月公開了名為 BISTRO 的宏觀經濟時間序列預測通用模型。 這個基於 Transformer 架構2 的模型,與傳統計量模型不同,無需針對特定任務進行設計。BIS 表示,該模型曾準確預測了 2021~2022 年通膨的持續性——當時大多數傳統模型機械地預測「將回歸均值」,結果大失所望。
3. 驗證——「捕捉錯誤的 AI,製造錯誤的人類」
第三種可能性最為微妙,也最為重要。AI 能否幫助篩除研究中的錯誤?
西北大學的 Ben Golub 教授共同創辦了一個名為 Refine.ink 的工具。這是一套基於 AI 的論文審查系統,能系統性地偵測數學錯誤、實證策略的漏洞以及邏輯一致性問題。據 Golub 教授表示,即使在通過頂尖期刊審查的論文中,也有至少三分之一以上存在問題。 芝加哥大學的 John Cochrane 教授將自己的通膨研究書放入 Refine 測試後,評價這是「40 年學術生涯中收到的最高水準的意見」。
經濟學五大期刊中已有數家開始試行導入 Refine。特別是在條件性接受發表前的最終檢查階段,使用最為自然——提前捕捉作者可能在出版後感到尷尬的錯誤。(類似服務有很多。其中我使用過的,推薦由韓國人開發的 https://jenni.ai/ 這個服務。)

真正的問題:速度的軍備競賽
看到這裡,AI 對經濟學來說似乎是相當正面的消息。但 Harford 提出了核心問題:
「AI 找到錯誤的速度,能否快過人類放棄尋找錯誤的速度?」
這不是單純的修辭學問題。分析 ICLR 2025(國際機器學習會議)收到的 7 萬份審查報告後,估計約 21% 從頭到尾都是由 AI 撰寫的。 這意味著不是 AI 輔助編輯,而是五份審查報告中就有一份完全由 LLM 生成。經濟學期刊中已經開始流傳「令人尷尬的草率 AI 審查報告」被提交的說法。
問題的結構可以這樣整理:
- 學術論文每年在全球湧現超過 500 萬篇
- 合格的審查者池無法跟上這個速度
- 同儕審查(peer review)是一項報酬低、激勵弱的工作
- 在這種情況下,當 AI 說「讓我來吧」,原本動機就不強的人類審查者就更沒有理由更努力了 這就是經濟學中所說的典型道德風險(moral hazard)3 結構。有了安全網,人們反而會更冒險——就像有了氣囊就超速駕駛一樣。
奧茲的視角
生產力工具直接提升產出品質的情況,其實比想像中少得多。Excel 出現時,我們期待會有更好的分析,但實際增加的只是「更多的試算表」。就像很難說 PowerPoint 提升了簡報品質一樣。
我覺得 AI 也走著同樣的路徑。生產力工具讓原本就做得好的人做得更好,但也讓原本就馬虎的人更大量地馬虎。Golub 教授自己也承認了這一點——他甚至在論文中經歷了「AI 撰寫的段落混入其中,看起來像是真正的工作」的情況。
我關注的是,像 Refine 這樣的工具能否超越單純的「錯誤偵測器」,成為學術品質的新基準線(baseline)。如果所有論文在提交前都要經過 AI 審查,人類審查者就能專注於 AI 捕捉不到的部分——原創性、理論貢獻、脈絡判斷。這可以不是威脅,而是分工的重新設計。
但問題在於,在過渡期必須承受「slop 的洪水」。我們現在正處於這場洪水的正中央。必須在傾瀉而下的 AI 內容洪流中存活下來……無論是短影音、部落格文章還是論文,都是如此。
結語
AI 正在減少經濟學家的瑣事、擴展研究範疇、並協助捕捉錯誤。但目前「更多研究」轉化為「更好研究」的證據仍然薄弱。 而且存在一個諷刺:捕捉錯誤的 AI 與更快大量製造錯誤的 AI,是同一項技術。
這不僅是經濟學的問題。程式碼審查、法律文件審閱、醫療診斷輔助——在所有 AI 承擔驗證角色的領域,都會反覆出現同樣的問題:有了安全網,人是會更謹慎,還是更粗心?
如果想深入了解這個主題,我推薦直接看看 BIS 的 BISTRO 模型論文,以及 Refine.ink 等服務。特別是 Refine 有免費試用版,只要把自己的文章或報告放進去,就能親身體驗 AI 驗證的水準。
參考資料 & 延伸閱讀
- Tim Harford, “Economists have caught the AI bug”, Financial Times, 2026. :本 newsletter 的起點專欄。平衡地探討了 AI 對經濟學的三條影響路徑。
- Koyuncu, B. et al., “Introducing BISTRO: a foundational model for unconditional and conditional forecasting of macroeconomic time series”, BIS Working Papers, 2026. :探討基於 Transformer 的宏觀經濟預測模型的結構與表現的論文。通膨預測案例令人印象深刻。
- Pataranutaporn, P. et al., “Can AI Solve the Peer Review Crisis?”, arXiv, 2025. :4 種 LLM 評估 1,220 篇經濟學論文的大規模實驗。同時展示了 AI 的品質辨識能力與偏見。
- Korinek, A., “AI agents for economic research”, NBER Working Papers No. 34202, 2025. :具體探索 AI 可應用於經濟學研究哪些階段的工作論文。



