透過隨機數生成緩解 LLM 作為評分者的評分偏差問題

arXiv - Computation and LanguageYuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn

本研究提出一種新方法,透過偵測並修正大型語言模型在評分時的潛在數字偏差,提升其作為自動評分者的準確性。

AI 幫你先抓重點

AI 重點 1

評分偏差具有高度的情境與模型依賴性

滑鼠懸停看 AI 判斷理由
這意味著我們不能使用一套通用的參數來校準所有 AI 評分工具。開發者必須針對特定的評分任務(如作文評分或程式碼檢測)進行個別的偏差偵測,才能確保評估結果的公平性與可靠性。
AI 重點 2

利用「隨機數生成」作為診斷工具的創新思維

滑鼠懸停看 AI 判斷理由
這提供了一種低成本且高效的診斷手段。透過觀察模型生成隨機數字的能力,我們能反向推導出模型在處理正式評分任務時的心理偏好,這為 AI 評估的品質控管提供了新的技術路徑。

核心研究發現

  1. 1

    研究發現 LLM 在擔任評分者時,會產生與文本內容無關的特定評分偏好,即所謂的評分偏差(Scoring Bias)。

  2. 2

    透過指令要求 LLM 生成隨機數字來識別其潛在的數字分佈偏差,並將此偏差納入下游任務的評分校準中。

  3. 3

    實驗結果顯示,在 LLM 對齊、摘要評估、語義文本相似度等四項任務中,該方法優於未校準的模型及現有的校準技術。

  4. 4

    研究證實評分偏差會隨著不同的模型、任務類型及評分範圍而變化,強調了針對特定情境進行偏差測量的必要性。

對教育工作者的啟發

對於致力於開發自動化學習評估系統(Automated Assessment)的教育科技開發者而言,此研究提供了重要的警示:AI 評分並非絕對客觀。在設計 AI 輔助評分工具(如自動批改作文或程式碼)時,不應僅依賴模型直接輸出的分數,而應建立一套「偏差校準機制」。建議在系統開發流程中加入「偏差偵測階段」,模擬模型在特定任務下的評分傾向,並透過數學校準來修正分數,以確保學生獲得的學習回饋是基於其真實表現,而非受模型偏好影響。

原始文獻資訊

英文標題:
Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation
作者:
Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn
來源:
arXiv - Computation and Language
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。