錯誤資訊是否更開放?研究 robots.txt 對網路內容的把關行為

arXiv - Computers and SocietyNicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

研究發現信譽良好的新聞網站比錯誤資訊網站更積極透過 robots.txt 限制 AI 爬蟲存取其內容。

AI 幫你先抓重點

AI 重點 1

AI 訓練數據可能存在結構性的品質偏誤

滑鼠懸停看 AI 判斷理由
由於高品質、具信譽的內容正透過技術手段主動避開爬蟲,這意味著 LLM 的訓練數據庫中,高品質資訊的比例可能相對降低,而錯誤資訊或低品質內容的比例則相對較高,這會影響 AI 生成內容的準確性。
AI 重點 2

網路內容的可及性呈現出日益嚴重的非對稱性

滑鼠懸停看 AI 判斷理由
這種「資訊把關」的行為正在改變網路生態,高品質資訊變得更難被自動化工具獲取,這對於未來如何建立透明、公平且具備倫理規範的 AI 訓練機制提出了嚴峻挑戰。

核心研究發現

  1. 1

    信譽良好的網站有 60.0% 會禁止至少一種 AI 爬蟲,而錯誤資訊網站僅有 9.1% 會在 robots.txt 中進行限制。

  2. 2

    信譽良好的網站平均禁止 15.5 種 AI 使用者代理(User Agents),而錯誤資訊網站禁止的數量平均低於 1 種。

  3. 3

    信譽良好的網站對於 robots.txt 指令的執行力較高,其主動阻擋 AI 請求的行為與宣告的指令更為一致。

  4. 4

    這種差異隨時間擴大,信譽良好的網站禁止 AI 存取的比例從 2023 年 9 月的 23% 增加到 2025 年 5 月的近 60%。

對教育工作者的啟發

對於教育科技開發者與內容提供者而言,此研究提醒我們在設計 AI 學習工具時,必須意識到訓練數據可能存在「品質偏誤」。若 AI 模型主要依賴較易抓取的數據,其產出的知識可能更偏向錯誤資訊。教育工作者在利用 AI 進行教學設計或知識建構時,應培養學生的批判性思考能力,特別是針對 AI 生成內容的真實性進行查證,因為 AI 的知識來源可能因網路技術把關而產生結構性的偏差。

原始文獻資訊

英文標題:
Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web
作者:
Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。