大規模 AI 評分手寫物理試卷:分數一致性與奧林匹亞選拔結果分析
arXiv - Computers and SocietyPraveen Pathak, Siddharth Tiwary, Charudatt Kadolkar, Vijay Singh, David Rakestraw, Shirish Pathare, Anwesh Mazumdar
研究證實 GPT-5.5 能高度準確地評分手寫物理試卷,其選拔結果與官方人工評分完全一致。
AI 幫你先抓重點
AI 重點 1
AI 應定位為「第二閱卷者」或「審計工具」而非完全取代人類。
滑鼠懸停看 AI 判斷理由
雖然 AI 在總分一致性上表現優異,但在複雜的實驗性部分給分仍有侷限。將其作為輔助工具,能在維持評分公平性的同時,大幅減輕教師負擔並提供審核機制。
AI 重點 2
精細化的評分指令(Rubrics)是提升 AI 評分可靠性的關鍵。
滑鼠懸停看 AI 判斷理由
研究顯示透過調整指令與要求 AI 定位證據,能顯著改善評分分歧。這提醒教育設計者,若要導入 AI 評分,必須開發極其詳盡且結構化的評分標準。
核心研究發現
- 1
AI 評分與官方人工分數的相關性極高,總分相關係數落在 0.91 至 0.97 之間。
- 2
在物理奧林匹亞最終選拔中,AI 評分選出的五名學生團隊與官方人工評分結果完全相同。
- 3
透過優化指令與證據定位,第二輪評分能有效提升問題細項的一致性,特別是針對首輪分歧較大的部分。
- 4
AI 在處理實驗性作業的精確部分給分(partial-credit)時仍面臨挑戰,是目前主要的技術難點。
對教育工作者的啟發
對於希望導入 AI 自動評分的教育者,建議採取「人機協作」模式。首先,開發者應建立極其細緻的結構化評分量表(Rubrics),並要求 AI 在給分時必須標註證據位置,以增加透明度。其次,針對實驗性或需要邏輯推導的開放式問題,應保留人工複核機制,將 AI 用於初步篩選或作為第二輪審核工具,以應對 AI 在部分給分(partial-credit)上的潛在誤差。這不僅能提升評分效率,更能確保高風險決策(如選拔)的公正性。
原始文獻資訊
- 英文標題:
- Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad Team Selection Outcomes
- 作者:
- Praveen Pathak, Siddharth Tiwary, Charudatt Kadolkar, Vijay Singh, David Rakestraw, Shirish Pathare, Anwesh Mazumdar
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。