透過隨機數生成緩解 LLM 作為評分者的評分偏差問題
arXiv - Computation and LanguageYuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn
本研究提出一種新方法,透過偵測並修正大型語言模型在評分時的潛在數字偏差,提升其作為自動評分者的準確性。
AI 幫你先抓重點
AI 重點 1
評分偏差具有高度的情境與模型依賴性
滑鼠懸停看 AI 判斷理由
這意味著我們不能使用一套通用的參數來校準所有 AI 評分工具。開發者必須針對特定的評分任務(如作文評分或程式碼檢測)進行個別的偏差偵測,才能確保評估結果的公平性與可靠性。
AI 重點 2
利用「隨機數生成」作為診斷工具的創新思維
滑鼠懸停看 AI 判斷理由
這提供了一種低成本且高效的診斷手段。透過觀察模型生成隨機數字的能力,我們能反向推導出模型在處理正式評分任務時的心理偏好,這為 AI 評估的品質控管提供了新的技術路徑。
核心研究發現
- 1
研究發現 LLM 在擔任評分者時,會產生與文本內容無關的特定評分偏好,即所謂的評分偏差(Scoring Bias)。
- 2
透過指令要求 LLM 生成隨機數字來識別其潛在的數字分佈偏差,並將此偏差納入下游任務的評分校準中。
- 3
實驗結果顯示,在 LLM 對齊、摘要評估、語義文本相似度等四項任務中,該方法優於未校準的模型及現有的校準技術。
- 4
研究證實評分偏差會隨著不同的模型、任務類型及評分範圍而變化,強調了針對特定情境進行偏差測量的必要性。
對教育工作者的啟發
對於致力於開發自動化學習評估系統(Automated Assessment)的教育科技開發者而言,此研究提供了重要的警示:AI 評分並非絕對客觀。在設計 AI 輔助評分工具(如自動批改作文或程式碼)時,不應僅依賴模型直接輸出的分數,而應建立一套「偏差校準機制」。建議在系統開發流程中加入「偏差偵測階段」,模擬模型在特定任務下的評分傾向,並透過數學校準來修正分數,以確保學生獲得的學習回饋是基於其真實表現,而非受模型偏好影響。
原始文獻資訊
- 英文標題:
- Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation
- 作者:
- Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn
- 來源:
- arXiv - Computation and Language
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。