聲望勝過實力:大型語言模型在同儕審查中的偏見審計

arXiv - Computers and SocietyAnthony Howell, Jieshu Wang, Luyu Du, Julia Melkers, Varshil Shah

研究發現 LLM 在模擬學術審查時,會因作者的機構聲望、性別與種族等身份標籤而產生顯著偏見。

AI 幫你先抓重點

AI 重點 1

LLM 並非中立的評審工具,而是會放大既有社會偏見的媒介。

滑鼠懸停看 AI 判斷理由
這挑戰了「AI 能消除人類主觀偏見」的常見假設。讀者必須意識到,若將 LLM 直接用於學術評鑑或自動化評分,可能會系統性地排擠弱勢群體或非頂尖機構的研究者。
AI 重點 2

身份標籤(Identity Cues)對 AI 決策的影響力甚至可能超越內容品質。

滑鼠懸停看 AI 判斷理由
這說明了模型在處理資訊時,會優先處理與身份相關的先驗知識(Priors)。在設計 AI 輔助教學或評量系統時,必須考慮如何進行「去識別化」以確保公平性。

核心研究發現

  1. 1

    當揭露作者身份後,即便論文內容完全相同,審查者的拒絕建議率也會平均降低約 25%。

  2. 2

    機構聲望是主要的偏見來源,隸屬於低聲望機構的論文在各學科領域中均獲得較低的品質評分。

  3. 3

    研究觀察到交織性偏見,低聲望機構的女性作者比高聲望機構的女性作者更容易獲得較低的評分與更高的拒絕率。

  4. 4

    模擬生成的履歷顯示,LLM 內建了與國家基準不符的聲望與資歷偏見,反映了訓練數據中的領域規範。

對教育工作者的啟發

對於教育科技開發者與學術管理者而言,此研究提供了重要的警示:在開發用於自動評分或學術審查的 AI 工具時,必須建立嚴格的「去識別化」機制,確保模型在評估時無法接觸到作者的機構、性別或種族資訊。此外,開發者應進行「偏見審計」(Bias Audit),測試模型在面對不同背景學生或研究者時的表現是否一致。在高等教育實務中,應建立對 AI 輔助決策的監督機制,避免將 AI 產生的偏見結果直接視為客觀事實,並持續檢視 AI 是否在無意中強化了學術階級制度。

原始文獻資訊

英文標題:
Prestige over merit: An adapted audit of LLM bias in peer review
作者:
Anthony Howell, Jieshu Wang, Luyu Du, Julia Melkers, Varshil Shah
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。