大規模 AI 評分手寫物理試卷:分數一致性與奧林匹亞選拔結果分析

arXiv - Computers and SocietyPraveen Pathak, Siddharth Tiwary, Charudatt Kadolkar, Vijay Singh, David Rakestraw, Shirish Pathare, Anwesh Mazumdar

研究證實 GPT-5.5 能高度準確地評分手寫物理試卷,其選拔結果與官方人工評分完全一致。

AI 幫你先抓重點

AI 重點 1

AI 應定位為「第二閱卷者」或「審計工具」而非完全取代人類。

滑鼠懸停看 AI 判斷理由
雖然 AI 在總分一致性上表現優異,但在複雜的實驗性部分給分仍有侷限。將其作為輔助工具,能在維持評分公平性的同時,大幅減輕教師負擔並提供審核機制。
AI 重點 2

精細化的評分指令(Rubrics)是提升 AI 評分可靠性的關鍵。

滑鼠懸停看 AI 判斷理由
研究顯示透過調整指令與要求 AI 定位證據,能顯著改善評分分歧。這提醒教育設計者,若要導入 AI 評分,必須開發極其詳盡且結構化的評分標準。

核心研究發現

  1. 1

    AI 評分與官方人工分數的相關性極高,總分相關係數落在 0.91 至 0.97 之間。

  2. 2

    在物理奧林匹亞最終選拔中,AI 評分選出的五名學生團隊與官方人工評分結果完全相同。

  3. 3

    透過優化指令與證據定位,第二輪評分能有效提升問題細項的一致性,特別是針對首輪分歧較大的部分。

  4. 4

    AI 在處理實驗性作業的精確部分給分(partial-credit)時仍面臨挑戰,是目前主要的技術難點。

對教育工作者的啟發

對於希望導入 AI 自動評分的教育者,建議採取「人機協作」模式。首先,開發者應建立極其細緻的結構化評分量表(Rubrics),並要求 AI 在給分時必須標註證據位置,以增加透明度。其次,針對實驗性或需要邏輯推導的開放式問題,應保留人工複核機制,將 AI 用於初步篩選或作為第二輪審核工具,以應對 AI 在部分給分(partial-credit)上的潛在誤差。這不僅能提升評分效率,更能確保高風險決策(如選拔)的公正性。

原始文獻資訊

英文標題:
Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad Team Selection Outcomes
作者:
Praveen Pathak, Siddharth Tiwary, Charudatt Kadolkar, Vijay Singh, David Rakestraw, Shirish Pathare, Anwesh Mazumdar
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。