巴納斯李選的 URL,四個月就掛了
但那篇文章本身,28 年來一直待在同一个位址

前言
1998 年,巴納斯李寫過一篇很短的文章。標題叫 “Cool URIs don’t change”,翻成中文大概是「好的位址不會改變」的意思。那是他寫給網頁管理者的一封近乎碎碎念的信。核心就一句話:
1他在文章裡挑了幾條好的位址當範例。其中一條是美國《Money》雜誌某篇文章的位址,巴納斯李還特別標註了「看起來不錯」。然而,掛著那個位址的網站 pathfinder.com,在 1999 年 4 月被時代華納整個關掉了。距離他點名稱讚,不過四個多月。
讀者 您好,這裡有個反轉。巴納斯李本人那篇文章,至今仍然活在 1998 年發布時的那個位址上。整整 28 年了。
這個對比就是今天這篇文章的起點。先說結論:連結會腐化,不是技術問題,而是誰決定要持續對那個位址負責的問題。而這個老問題,在 2026 年突然又變得重要起來了。因為讀網頁的主體正在從人變成機器,連結的角色也從「去的路」變成了「證據」。
網頁消失的速度,比你想的快得多
先看看到底消失了多少。皮尤研究中心 2024 年發布的一項調查,是這個領域最值得引用的實測數據。他們從 Common Crawl2 的資料中,每年抽取約 90 萬個頁面,追蹤了 2013 年到 2023 年的變化。
結果是這樣:2013 年存在的網頁,到 2023 年 10 月已有 38% 無法存取。 也就是說,十年之後,每三個頁面就有一個以上消失了。更誇張的是,2023 年的頁面裡也有 8% 已經打不開了。不到一年。
更值得注意的是維基百科。他們調查了五萬篇維基百科條目,結果54% 至少包含一條失效的參考文獻連結。我們查資料時最先打開的那個頁面,超過一半其實已經丟失了一部分自己的依據。
到了法庭上,情況更嚴重。哈佛法學院的喬納森・齊特林和勞倫斯・萊西格團隊 2014 年發表的研究顯示,1996 年到 2011 年間美國聯邦最高法院判決書中引用的 URL,約有 50% 已不再包含原始內容。 《哈佛法律評論》論文中的連結情況更糟,原文完整保留的只有 26.8%。
這裡有兩個研究區分出來的概念很重要。連結腐化(link rot)是指按下位址後出現錯誤訊息的情況。引用腐化(reference rot)3 則是位址還能正常打開,但內容已經被改掉了。研究團隊發現,後者其實更常見。也就是說,「裝著沒斷的連結」比「真的斷掉的連結」更多。 這為什麼危險,待會兒再說。
有一點要特別指出:這些數據全部是以美國為中心的樣本。我還沒看過用同樣方法測量的韓文網頁流失率的公開資料。不過想想 Naver 部落格和咖啡廳服務的終止、Daum View 和 MiToday 這類整個消失的平台、各大媒體的資料庫改版……韓國的情況應該也不會好到哪去。
巴納斯李的診斷:這不是技術問題,是組織問題
讓我們回到 1998 年那篇文章。巴納斯李有意思的地方在於,他不認為這是技術缺陷。
他逐條列出管理者常用的藉口,然後一一反駁。「我們改版了」「檔案必須搬家」「那個檔案現在不是 John 管了,是 Jane 管」「以前用 CGI 腳本,現在改用二進位程式了。」然後他反問:那當初為什麼要把 John 的名字放進位址裡?
他的開藥方可以濃縮成一句話:設計位址,大部分時候是在決定「不放什麼」。
他列出的「不要放」清單如下:作者姓名(人會離職)、主題分類(分類體系一直在變)、文件狀態(draft、latest、old 之類的)、存取權限區分(團隊專用、會員專用、公開)、檔案副檔名(.html 也有換的一天)、軟體痕跡(cgi-bin、.pl)、甚至磁碟名稱。真正可以留的其實只有一個:發布日期。因為日期永遠不會變。
再讀一遍這份清單,會發現一個共同點:所有被要求拿掉的項目,全都是組織內部的狀況。 誰負責、隸屬哪個部門、處於哪個階段、用什麼技術棧。位址斷掉,不是因為伺服器壞了,而是因為組織把內部結構刻進了對外公開的名字裡。組織一變,名字就跟著塌了。
我想把這叫做**「位址是組織架構的化石」**。看看一家公司的 URL 結構,大概就能讀出它哪一年做了什麼團隊重組。/2019/newbiz/、/ai-innovation/、/dx-center/ 這類路徑。然後那個團隊一消失,路徑也跟著消失了。
巴納斯李甚至把這推到道德義務的層面。「制定一個兩年後、二十年後、兩百年後都能守得住的位址,是網頁管理者的責任。」以 1998 年的標準來說,這聽起來有點過分了。但現在回頭看,反而覺得他講得還不夠。
AI 開始讀網頁之後,連結的角色變了
好,這裡是今天的核心。
過去 28 年,斷掉的連結主要只是不方便。點下去看到 404,煩一下,重新搜尋就好。但現在不一樣了。人不再自己搜尋,而是問 AI,AI 去讀網頁、生成答案、然後在底下附上來源。在這個結構裡,連結不再是「移動路徑」,而是**「這句話屬實的證據」**。
但那些證據,運作得並不怎麼好。
哥倫比亞新聞評論的托中心(Tow Center)2025 年 3 月發布了一項調查。他們從 20 家媒體的文章中抽取引文,問了 8 種聊天機器人的出處。總共 1,600 個提問,結果是:超過 60% 的回答是錯的。 Grok3 的錯誤率達 94%,它給出的 200 條引用連結中有 154 條(77%)指向錯誤頁面。Gemini 和 Grok3 的回答中,超過一半包含了不存在或已斷掉的 URL。
這項調查裡最讓我有觸動的是另一點:付費進階模型的錯誤率反而更高。 它們不知道的時候不會說不知道,而是自信滿滿地給出錯誤答案。因為附有來源連結,看起來更可信,但點進去發現頁面根本不存在。
這裡又回到了前面提到的引用腐化。連結 404 了,至少我們還能察覺。真正的问题是位址還在、內容卻被改了。AI 把三年前的學習內容掛在現在的 URL 上,除非人親自點進去確認,否則根本發現不了。而大多數人不會點。
而且網頁正在另一個方向上關門
還有一個問題。上面講的是「機器讀錯了網頁」,這次是「網頁對機器關上了門」。
Cloudflare 在 2025 年 7 月 1 日改了政策。新註冊的網域預設封鎖 AI 爬蟲,必須由網站管理者主動允許才能進入。基礎設施業者把這設為預設值,還是頭一回。同時他們也推出了「Pay Per Crawl」按次計費功能。4
這個決定背後有一個 Cloudflare 公開的指標:爬取與轉介比率5,也就是 AI 公司每抓取一個網站多少次,才能換回一個訪客。以 2025 年 6 月第四週為基準,Anthropic 大約是 70,900 比 1。抓了七萬次才送回來一個人。反過來,Mistral 是 0.1 比 1,送回來的人比抓取的次數還多十倍。各家公司之間的差異非常大。
不過這個數字要謹慎解讀。Cloudflare 自己也說了,應用程式產生的流量不會帶轉介標頭,所以網頁工具的比率可能被高估了。但大方向是清楚的:網頁現在是被刮的地方,不是被找來的地方。
那會發生什麼事呢?網站開始關門。用 robots.txt6 擋住、轉為付費、藏到登入牆後面。這些都是合理的選擇。但由此產生的結果有點諷刺:
- 人要親自確認就得點連結,但很多連結已經斷了
- 問 AI 的話,答案會出來,但出處有 60% 以上是錯的
- 想去看原文,又被爬蟲封鎖和付費牆擋住
三個方向都在消失驗證路徑。 這才是連結腐化在 2026 年重新變得重要的真正原因。
奧斯瓦爾德的視角
我對把這個問題當成「存檔問題」的看法有點不耐。好像只要網際網路存檔中心努力存就好了。存檔是事故後的保險,不是事故預防裝置。
做顧問期間,我見過好幾次網站改版專案,URL 結構的討論幾乎永遠是最後才出現的。品牌定了、設計確認了、CMS 選好了,然後開發者才問「轉址怎麼處理?」到那個時候,資訊架構已經跟著新組織圖排好了。改版後幾個月流量掉了,大家都怪內容。其實是自己把累積下來的連結資產丟掉了。
做 GTM 策略時我常說一句話:「現在取的名字,三年後的你得接得住。」產品名、訂閱方案名、功能名,還有 URL。全部是同一個原理。名字裡塞進越多當下狀況,現在越好解釋,將來就一定會斷。/2024_最終_真的最終.pptx 和 /cgi-bin/browse.pl 是完全一樣的失敗。
但 AI 時代有一件事根本性地變了。以前穩定的 URL 是 SEO 資產。現在是可引用性資產。我判斷,擁有穩定位址、能被 AI 作為依據引用的組織,和每次改版都換掉位址的組織,之間的差距會越來越大。因為連結保住了,時間越長引用越累積;引用累積了,那個網域本身就會被當作依據來看待。
當然這是我的解讀,目前還缺乏足夠的公開數據來支撐。長期追蹤 AI 回答中各網域被引用頻率的研究所,才剛起步。但我覺得這個方向值得押注。因為成本幾乎为零。維護一條轉址規則的費用接近於零。
結語
整理一下。
- 網頁消失得很快。 2013 年的頁面已有 38% 不見了,維基百科條目的 54% 含有失效的參考文獻。
- 原因不是技術,是組織。 把負責人、部門、技術棧這些內部狀況刻進位址裡,組織一變,名字就跟著塌了。
- AI 開始讀網頁之後,賭注變大了。 連結不再是移動路徑,而是證據。但聊天機器人的出處有 60% 以上是錯的,同時網頁正在對爬蟲關門。
現在就能做的事,其實出乎意料地小。下次要改版網站或文件體系的時候,在定新位址之前,先列一個清單:現在這個位址裡,哪些是可以拿掉的。 部門名、負責人、狀態、副檔名。光是把這些清掉,下次改版時存活的機率就會大幅提升。巴納斯李的原文至今還在同一個位址上(見下方參考資料),半小時就能讀完。
💬 您有沒有因為改版或遷移,把舊連結整個弄丟的經驗?當時最遺憾的是什麼?歡迎在留言區分享。我會整理一份連結維護檢查清單,放到下一期裡。
📨 如果您身邊有人正在準備網站改版,請把這篇文章轉給他們。
參考資料 & 延伸閱讀
核心出處
- Tim Berners-Lee, “Cool URIs don’t change”, W3C Style Guide, 1998. 查看原文 ··· 本期電子報的起點。28 年來一直待在同一个位址這件事本身,就是這篇文章的論證。
- Athena Chapekis, Samuel Bestvater, Emma Remy, Gonzalo Rivero, “When Online Content Disappears”, Pew Research Center, 2024 年 5 月 17 日. 查看報告 ··· 談論連結腐化時最值得引用的實測數據。建議連方法論章節一起讀。
- Jonathan Zittrain, Kendra Albert, Lawrence Lessig, “Perma: Scoping and Addressing the Problem of Link and Reference Rot in Legal Citations”, Harvard Law Review Forum, Vol. 127, 2014. 查看論文 ··· 區分「連結腐化」與「引用腐化」的研究。本文最重要的概念就出自這裡。
- Klaudia Jaźwińska, Aisvarya Chandrasekar, “AI Search Has a Citation Problem”, Columbia Journalism Review / Tow Center, 2025 年 3 月 6 日. 查看調查 ··· 以 1,600 個提問比較 8 種聊天機器人的調查。各工具的錯誤率對比表特別值得一看。
- Cloudflare, “The crawl before the fall… of referrals”, Cloudflare Blog, 2025 年 7 月 1 日. 查看分析 ··· 整理了爬取與轉介比率的定義和各公司數據。測量限制也在正文中坦率地寫了。
背景知識
- Cloudflare, “Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large”, 2025 年 7 月 1 日. 查看新聞稿 ··· AI 爬蟲預設封鎖政策的原文。我認為這份文件會被記錄為網頁存取規則的轉折點。
- “Pathfinder (website)”, Wikipedia. 查看條目 ··· 巴納斯李舉為範例的那個網站的最終下場。1999 年 4 月關站。
- Perma.cc, 哈佛法學院圖書館創新研究所. 查看服務 ··· 上述論文提出的解決方案落地為實際服務的案例。問題提出到基礎設施落地,相當罕見,值得一看。
📝 術語說明
각주
-
URI(Uniform Resource Identifier,統一資源識別符):網頁中用來指向資源的位址體系。我們常說的 URL 是 URI 的一種。巴納斯李用 URI 這個詞,是因為他認為「指向什麼」比「在哪裡」更重要。 ↩
-
Common Crawl(通用爬取):定期抓取整個網頁並免費公開的非營利存檔機構。也是大規模語言模型訓練資料的重要來源之一。 ↩
-
引用腐化(reference rot):連結能正常打開,但裡面的內容已經與原本引用的不同。因為不會出現錯誤訊息,所以比連結腐化更難察覺,也更棘手。 ↩
-
Pay Per Crawl:Cloudflare 推出的功能,讓網站管理者可以對 AI 爬蟲的存取設定計費。不是簡單的封鎖或允許二分法,而是加上價格機制。 ↩
-
爬取與轉介比率(crawl-to-refer ratio):表示 AI 服務每抓取一個網站多少次,才能將一個訪客轉介回該網站的比率。數字越大,代表「拿得多、送得少」。 ↩
-
robots.txt:放在網站根目錄的純文字檔案,記載哪些爬蟲可以進入哪些路徑的慣例。沒有法律強制力,更接近依賴爬蟲自發遵守的君子協定。 ↩



