重點摘要
AI 正在提取人類千年知識遺產,卻沒有人問過:拿走之後,剩下什麼?
Disney 刪除 FiveThirtyEight 逾三萬八千篇文章、維基百科人類流量暴跌 8%、AI 爬蟲佔最耗資源流量的 65%——這不是漸進式衰退,而是系統性的數位記憶清洗。
出版商封鎖 AI 爬蟲時,Internet Archive 與學術研究工具也遭到連帶封鎖;Reddit 被企業植入內容以污染訓練資料,公共記錄在被存檔前就已腐化。
結構化技術知識(工廠手冊、硬體整合指南)或許能在 AI 中介後倖存,但依賴人類脈絡的意見、敘事與社群知識面臨滅失風險。
前情提要
章節一:當 AI 爬蟲取代讀者,網站紛紛關閉大門
2024 年,約有 40% 的 AI 爬蟲偽裝成 Chrome 或 Firefox 瀏覽器,以繞過網站的封鎖規則。arXiv 在 2025 年 5 月發表的研究確認,AI 爬蟲對 robots.txt 指令採取選擇性遵守,實質上瓦解了維繫三十年的網路爬蟲社會契約。
名詞解釋
robots.txt 是網站根目錄的純文字檔,用來告知爬蟲哪些頁面可以抓取、哪些禁止存取;這份慣例從 1990 年代沿用至今,是開放網路的基礎信任機制。
當出版商採取激進封鎖措施對抗 GPTBot 等 AI 爬蟲時,Internet Archive、學術研究者、新聞監測工具與無障礙輔助程式也一併遭殃。這種連帶損害並非意外,而是技術架構上無法區分「惡意爬蟲」與「善意爬蟲」所造成的結構性矛盾。
Cloudflare 在 2025 年推出付費授權的 AI 爬蟲存取模型,將「抓取權」從開放慣例轉型為商品。這個訊號意味著,開放網路的規範正在終結,取而代之的是以金錢決定誰能存取知識的新秩序。
章節二:消失的不只是網頁,而是人類數位記憶
2026 年 5 月 19 日,Disney 悄悄將 FiveThirtyEight 的網域重新導向,三萬八千五百餘篇存檔文章就此蒸發。Nate Silver 估計這代表超過 20 萬小時的新聞工作量被徹底抹去,而他主動提出購買存檔時,被 Disney 告知「滾開」。這不是一次意外失誤,而是企業對知識遺產的蓄意遺棄。
維基百科在 2025 年的人類訪問量年減 8%,原因是 AI 系統直接在搜尋結果頁面提供答案,讓使用者不必點擊進入原始頁面。與此同時,AI 爬蟲卻佔據了維基百科最耗資源流量的 65%——維基媒體基金會因此在 2025 年 11 月正式要求 AI 公司停止免費使用維基百科資料,並透過官方 API 付費存取。
Internet Archive 的 Wayback Machine 在 2024 年 10 月遭到網路攻擊,三千一百萬筆使用者帳號外洩;同年 6 月又因出版商訴訟被迫下架五十萬本書籍。這個長期作為人類數位記憶保管人的機構,正在雙重壓力下承受前所未有的生存威脅。
Instagram Stories、WhatsApp 群組對話等龐大的文化與政治論述,從設計上就不會被存檔。這些「消逝的設計」與企業蓄意刪除的存檔,共同構成了數位記憶的系統性缺口,而 AI 的崛起正在加速這個進程。
章節三:創意內容 vs 技術知識:AI 衝擊的不對稱分布
HN 社群討論中出現了一個值得深究的反例。使用者 mc3301 指出:對於非創意性的技術知識——例如將某硬體 ABC 接入軟體 XYZ 並使用 RST 協定——LLM 或許比人類更擅長消化工廠手冊,並針對特定情境給出解答。這個觀察揭示了 AI 衝擊的不對稱性:結構化、程序化的技術知識或許能在 AI 中介後倖存。
真正的危機集中在另一端:依賴人類脈絡、情感與社群共識才能存活的知識形式——新聞分析、文化評論、個人敘事、社群辯論。當 AI 成為資訊的主要中介者,它能夠重述事實,卻無法繼承語境;它能夠摘要論點,卻無法保存爭議的溫度。
Google 的 AI 摘要已產生可查驗的錯誤資訊,包括錯誤的日落時間。德國法院裁定 Google 應為 AI 生成的虛假陳述負責,這是首次有法律嘗試將 AI 中介者綁定於準確性標準。更根本的問題是:即使原始頁面仍然存在,也因為被搜尋結果的 AI 摘要層遮蔽而「實際上無法被發現」。
Reddit 的情況更為弔詭——企業正在人工植入內容以操控 AI 生成的搜尋答案,從源頭污染公共記錄,讓存檔本身就帶著偏見。這意味著我們失去的不只是記憶,而是記憶的可信度。
章節四:搶救集體記憶的可能路徑
面對這場系統性的數位記憶清洗,各方已出現初步的結構性回應。法國採用 Qwant 作為政府搜尋引擎,並強制公務員使用 Tchap 訊息應用程式;歐盟委員會加入 W Social 獨立社交平台。這些早期案例開始將資訊基礎設施視為公共主權議題,而非純粹的市場問題。
Cloudflare 的付費爬蟲模型雖然代表開放網路慣例的終結,卻也創造了一個可能的資金流向:若爬蟲授權費能回流到內容創作者與存檔機構,或許能為知識保存提供新的商業基礎。維基媒體基金會的 Enterprise API 模式走的也是同一條路。
從技術面看,增強 robots.txt 的執行機制、建立可驗證的爬蟲身份標準、開發能區分善意與惡意爬蟲的技術層,都是可能的工程路徑。但這些方案都面臨一個根本困境:標準需要參與者自願遵守,而 AI 產業的誘因結構恰恰讓遵守成本遠高於違規成本。
最終,集體記憶的存亡或許不只是技術問題,而是政治意志的問題。人類是否有意願,在 AI 帶來的效率紅利之外,同時為知識的長期可及性付出代價?
多元觀點
正方立場
AI 搜尋摘要提供即時、低門檻的資訊存取,對時間有限的使用者而言是真實的效率提升。結構化技術知識(硬體整合指南、工廠手冊)在 AI 中介後或許傳播更廣、更易理解。
此外,部分低品質或過時內容的自然淘汰並非純粹損失;AI 作為過濾層,理論上能將使用者導向更高信噪比的知識,而非讓他們在無限的網路噪音中自行篩選。
反方立場
AI 爬蟲正在系統性地摧毀開放網路的信任基礎:40% 爬蟲偽裝身份繞過封鎖、選擇性忽視 robots.txt 契約、並讓出版商陷入封鎖 AI 爬蟲卻連帶傷害 Internet Archive 的兩難。
更根本的是,AI 中介創造了「答案的幻覺」:即使原始頁面仍然存在,也因為被 AI 摘要遮蔽而「實際上無法被發現」。FiveThirtyEight 的消失是企業意志的展現;德國法院判決 Google 對 AI 錯誤資訊負責,則揭示了 AI 摘要層根本上不可信任的現實。
中立/務實觀點
真正的危機並非 AI 本身,而是誘因結構的失衡:AI 公司從爬取中獲利,卻不承擔內容消失或記憶失真的外部成本。
務實的出路不是禁止 AI 爬蟲,而是重建成本內化機制——無論是 Cloudflare 的付費授權模型、Wikimedia Enterprise API,或是法律責任標準的確立。技術知識或許能倖存,但文化記憶、社群論述、新聞分析等依賴人類脈絡的知識形式,需要刻意設計的保護機制,而非寄望於市場自動修正。
實務影響
對開發者的影響
若你管理有公開內容的網站,需要立即評估 robots.txt 的實際效力——2025 年 arXiv 研究已確認大量 AI 爬蟲選擇性忽視這份慣例。封鎖 GPTBot 與 CCBot 可能是合理選擇,但需留意連帶影響 Internet Archive 爬蟲的風險。
Cloudflare 的付費爬蟲授權模型值得追蹤:若成為產業標準,你的爬蟲整合邏輯與 API 授權政策都需要對應調整。
對團隊/組織的影響
媒體機構與知識型組織應立即評估自身存檔策略,不應假設 Google 快取或第三方平台會保存你的內容。FiveThirtyEight 案例的教訓是:內容的長期生存不能委託給平台方。
若組織有大量依賴 Reddit、HN 等公共論壇的知識積累,需意識到這些平台正在成為企業植入內容的污染場域,相關決策的資訊品質可能已受影響。
短期行動建議
- 為重要內容建立不依賴第三方平台的存檔副本(包含提交至 Wayback Machine)
- 評估是否透過 Wikimedia Enterprise API 等官方授權管道使用 Wikipedia 資料
- 若有 AI 產品依賴網路爬取資料,提前評估 Cloudflare 付費模型帶來的成本衝擊
社會面向
產業結構變化
搜尋廣告的傳統商業模式正在瓦解——當 AI 摘要取代點擊,廣告收入隨流量一同蒸發,出版業的商業基礎動搖。維基百科等依賴使用者捐款的機構,在流量下滑 8% 的同時,卻要承擔 AI 爬蟲 65% 的高資源流量成本。
Instagram Stories、WhatsApp 對話等「消逝設計」的平台,讓大量文化與政治論述從未進入任何存檔系統。AI 產業的崛起並未解決這個問題,反而加速了有記錄的知識向 AI 中介者集中、無記錄的知識徹底消失的兩極化趨勢。
倫理邊界
這場爭議的核心倫理問題是:當 AI 公司從人類數十年積累的知識遺產中提取價值時,這是合法的技術進步,還是 smackeyacky 所說的「史上規模最大的智慧財產權竊盜」?
德國法院對 Google AI 錯誤資訊的判決開創了先例:AI 中介者不能只享受聚合資訊的紅利,卻逃避資訊失真的責任。這個邊界的確立,可能成為整個 AI 產業商業模式的重大轉折點。
長期趨勢預測
法國與歐盟委員會將資訊基礎設施視為主權議題的舉動,預示著一個分裂的網路未來:部分國家或地區將建立受監管的知識生態系,AI 爬蟲必須在許可框架內運作;其餘地區則繼續當前的無規範提取模式。
結構性技術知識(手冊、規格書、程式文件)因其機器可解析的特性,可能在 AI 中介後獲得更好的傳播;但文化記憶、社群論述、新聞分析等「人類脈絡知識」若缺乏刻意保護,將面臨世代性的滅失。
唱反調
AI 搜尋摘要讓使用者更快找到答案,降低了資訊不對稱的門檻——對沒有時間深讀的人來說,這是可及性的真實提升,而非純粹的損失
部分低品質、過時或偏頗的內容消失並不完全是壞事;AI 作為過濾器或許正在淘汰確實不值得保存的噪音,而非摧毀真正的集體記憶
社群風向
我完全同意上述觀點。不過,對於非創意性的事物——例如把某硬體 ABC 接入軟體 XYZ 並使用 RST——LLM 或許更擅長消化工廠手冊,並針對使用者的特定情境給出解釋。
讓我們來談談史上規模最大的 AI 智慧財產權竊盜,或者優步在取得許可前的非法營運,或者鍍金時代強盜男爵的公開勾結,或者鴉片戰爭。或者奴隸制度與新大陸的歷史。讓我們來談談這些。
(拿頭撞桌)你在讀一段描述,卻把它聽成了背書。
我不確定我理解這個邏輯……世界上存在客觀現實,那些絕對不是「意見」。按照這個邏輯,重力的存在是因為意見恰好一致嗎?
AI 模型在污染的網路爬取資料海洋中訓練,1995 年後的內容、新聞稿、維基百科編輯與循環事實查核,將稀疏的真相訊號淹沒其中。
炒作指數
行動建議
測試你的網站對各主要 AI 爬蟲(GPTBot、CCBot、Anthropic-AI)的回應——確認 robots.txt 是否按預期生效,並評估封鎖 AI 爬蟲是否連帶影響 Internet Archive 的存檔能力
若你管理知識型產品或媒體平台,評估為 AI 公司提供結構化資料授權介面(參考 Wikimedia Enterprise API 模式),而非任由爬蟲免費抓取,並將授權費導入內容創作成本
追蹤 Cloudflare 付費爬蟲模型的採用情況,以及德國法院判決對 AI 中介者準確性責任的後續影響——這兩條線將決定 AI 與開放網路共存的新規則能否成型