社會第 195 期

AI 寫了美國獨立宣言?

誤判率最高 61%,寫得好的文章反而更危險的原因

AI 寫了美國獨立宣言?

引言

美國愛達荷州立大學化學系的洛倫・賈格(Lauren Jaeger)在申請博士班時,看到了一則奇怪的警告。部分申請系統提示:「若自我介紹信中偵測到 AI 撰寫痕跡,將整份申請書作無效處理。」賈格根本沒有使用過 AI。但出於不安,她把自己的文章放進幾個線上偵測器試試看,結果全部顯示「幾乎 100% 是 AI 寫的」。

賈格最終重寫了自我介紹信。而且不是為了寫得更好,而是為了不觸發偵測器,刻意寫得「不那么完美」。她把自己的文章得分壓低到 30% 才交出去,心想「這樣應該沒問題了」。(幸好她順利錄取了猶他大學的博士班。)

差不多同一時期,網路上出現了一件更荒謬的事。有人把 1776 年寫成的美國獨立宣言放進某個偵測器,結果判定「95%~100% 是 AI 寫的」。那可是 250 年前的文件啊。

這裡就產生了一個問題:大學為了抓作弊而使用的這些工具,真的可以信嗎?先說結論,真正的問題不在偵測器偶爾「判錯」,而在於把一個可能出錯的工具當成「不可動搖的證據」來使用。

🔍 大學為何對偵測器如此依賴

生成式 AI(如 ChatGPT)出現後,請人代寫文章的費用幾乎趨近於零。西悉尼大學負責學術誠信的凱絲・艾莉絲(Kath Ellis)將此稱為「規模的根本性變化」。以前也有代筆,但現在是「至少相當大比例被操縱或捏造的內容,其數量本身呈爆炸式增長」。

問題在於,現有的武器不太管用了。像 Turnitin 這樣的抄襲檢測工具,是透過比對龐大的既有出版物來找出「抄襲痕跡」。但生成式 AI 生成的句子不是從哪裡整段搬來的,而是每次即時組合出來的。沒有可比對的原文,所以抄襲檢測抓不到。AI 是學習了過去海量文章後產出的結果,但恰恰是用比對過去文章的抄襲工具抓不到的——這就是矛盾所在。

於是,宣稱能判斷「這篇文章是其他 AI 寫的」的偵測器出現了。Copyleaks、GPTZero、ZeroGPT,以及 Grammarly 和 QuillBot、Turnitin 推出的工具,紛紛進入市場。面對湧入的作業和申請書,大學和研究生院開始依賴這些工具。

為什麼「寫得好的文章」會被判定為 AI

許多偵測器依賴一個叫困惑度(perplexity)1 的指標。簡單來說,就是衡量「下一個詞有多可預測」的數值。AI 寫的文章在統計上傾向於流暢、可預測的模式。因此,困惑度越低(越可預測)的文章越容易被懷疑是「機器寫的」,而用詞跳脫、多樣的則被判定為「人寫的」。

看出問題了嗎?照這個邏輯,文法精確、行文流暢無多餘的人,反而越容易被懷疑是 AI。賈格說「我研究過文法書,嚴格遵守規則來寫,所以可能被誤認為 AI 了」——講的正是這個點。因為寫得好而被標記。

這裡還有更嚴重的問題:非英語母語者。2023 年,史丹佛大學研究團隊將 91 篇在 ChatGPT 出現之前(2020 年以前)撰寫的 TOEFL 作文放進 7 個偵測器測試。

結果令人震驚。平均 61.3% 被誤判為「AI 寫的」。 而美國八年級(13~14 歲)學生寫的英文文章,則幾乎都被正確歸類為「人寫的」。

非母語者的文章用詞多樣性相對較低,困惑度因此偏低,偵測器便誤以為「像 AI」。61% 的誤判率2,意味著 10 個被冤枉的學生中有 6 個。

獨立宣言被標記也是同樣的原理。250 年來被無數次引用和修飾的句子,在統計上非常「可預測」。Nature 期刊直接將 1776 年原文的一部分多次放入 ZeroGPT 測試,每次結果都是 95%~100% AI。

這算例外事故嗎?不是。2025 年一項研究驗證了被認為最廣泛使用的 GPTZero,結果顯示它能以高置信度捕捉 AI 文章,但將人寫的文章誤判為 AI 的比例約為 16%。 研究團隊的結論是「區分人寫文章的可靠性有限」。

⚡ 即使有更精確的偵測器,問題依然存在

當然,不是所有偵測器都這麼不準。紐約的 Pangram Labs 宣稱誤判率「幾乎為零」。他們的 approach 不同。透過大量學習人寫的文章和讓 AI 重寫後的版本,讓系統在每個新聊天機器人生成時都能學習其文風。不只依賴困惑度一個指標。芝加哥大學布斯商學院和馬里蘭大學的獨立評估也顯示,準確度從未低於 99.8%。

但這裡正是我想強調的。偵測器變得更精確,問題也不會就此結束。

第一,混合文本。 研究 AI 對學術界影響的麥克・帕金斯(Mike Perkins,英國大學越南分校)說:「純 AI 文章偵測器抓得還算準,但一旦有人開始修改,偵測就崩潰了。」甚至不需要人親自改。只要讓另一個 AI「重寫一下」,或用專門設計來降低偵測分數的「人性化工具(humanizer)3」處理一下就行。偵測公司想抓這些規避工具,新的規避工具又會出現。用帕金斯的話說,這是「對誰都沒好處的巨大軍備競賽」。

第二,更根本的問題。 今年,馬爾珍娜・卡平斯卡(Marzena Karpinska)研究團隊利用 Pangram 分析了 2025 年夏天美國 1,500 家報紙的 18 萬 6 千篇文章。約 9% 被偵測出部分或完全由 AI 撰寫。這個數字很有意思。但卡平斯卡本人明確指出:這可以用於觀察「大規模趨勢」,但不應該作為判定個別作者有罪的依據。

「不能以此為由大規模淘汰人。」

這句話就是今天這篇文章的核心。同一個工具,用於「趨勢分析」可能有效,但用於「個人審判」卻不恰當。統計和判決是兩回事。

奧斯瓦爾德的視角

老實說,我不把這個故事讀成「偵測器性能」的爭論。作為長期處理數據的人,我首先注意到的是「閾值(threshold)」和「基礎率(base rate)」。

做數據分析時,我常遇到一個陷阱:一個準確度 99.9% 的模型,如果目標群體足夠大、而「真正陽性」很稀少,就會製造出相當多冤枉的人。

舉例來說,假設有一個誤判率 0.1% 的頂級偵測器。對 1 萬名誠實自己寫文章的學生使用,其中約 10 人會無辜地被標記為「AI 作弊者」。對那 10 個人來說,99.9% 的準確度一點安慰都沒有。

帕金斯指出的也是同一脈絡。人們看到分數就直接相信了。抄襲檢測時代,有「這句話和那篇論文一模一樣」這種看得見的證據。但 AI 偵測分數沒有這種證據。「87% AI」這個數字到底是基於什麼,學生和教授都無法驗證。在制定 GTM 策略時,我多次看到「用數字包裝的確定感」有多容易誤導組織。分數應該輔助判斷,但常常直接取代了判斷。

所以我的結論是:偵測器可以用來作為「調查線索」。但一旦把它當成「有罪證據」,像賈格這樣寫得好的人和非母語者就會最先被網住。不是要廢除工具,而是只給工具的輸出施加與之相稱的權重。

結語

今天這篇文章用三句話總結:

第一,許多 AI 偵測器會將「寫得好的文章」和「非母語者的文章」誤判為 AI,誤判率最高達 61%。 第二,即使有更精確的偵測器,面對混合文本和人性化工具仍會失效,而且「趨勢」和「個人審判」是兩回事。 第三,危險的不是工具出錯,而是把可能出錯的分數當成證據來相信的態度。

如果你正在評估或提交文章的崗位上,請只記住一件事:AI 偵測分數是「起點問題」,不是「終局判決」。

賈格為了通過審查,刻意把自己的文章改得「不那么完美」。為了不觸發偵測器而主動把文章改差——這種情況,你是否曾經經歷過自己的文章或學生、同事的文章被冤枉標記為 AI?歡迎在留言區分享你的經歷。我會考慮在下一期中反映。


💬 被冤枉標記為 AI 的經歷,歡迎留言分享。下一期會參考。

📨 覺得對寫文章的同事有幫助的話,請轉發這篇文章。


參考資料 & 延伸閱讀

核心來源

背景知識

原文

安光涉(Oswarld)個人插畫

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. 困惑度(perplexity):衡量下一個詞有多可預測的數值。越低代表句子越「套路化」,越容易被判定為 AI;越高則越像人寫的。

  2. 誤判率(false positive rate):實際是人寫的文章卻被誤判為「AI 寫的」比例。可以理解为無辜者被牽連的比例。

  3. 人性化工具(humanizer):將 AI 寫的文章改寫得像是人寫的,以降低偵測分數的工具。