從評估模型轉向評估輔助:大型語言模型在程式考試難度校準的多證據研究

arXiv - Computers and SocietyHongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen

本研究證實 LLM 可作為程式考試難度的輔助證據,協助校準平行班級間的評量公平性。

AI 幫你先抓重點

AI 重點 1

將 LLM 的角色從「被評估對象」轉向「評估輔助工具」

滑鼠懸停看 AI 判斷理由
這改變了教育者看待 AI 的視角。不再僅僅是測試 AI 能否解題,而是利用 AI 的解題能力作為一種「數位標竿」,來輔助人類教師理解題目難度,從而提升評量設計的科學性。
AI 重點 2

識別出 AI 評估在不同難度層級課程中的效能邊界

滑鼠懸停看 AI 判斷理由
研究指出 AI 在進階課程表現穩定,但在入門課程(CS101)中相關性驟降。這提醒教育工作者,AI 輔助評量並非萬靈丹,必須考慮學生知識基礎與群體特性的干擾。

核心研究發現

  1. 1

    在同步進行的考試中,AI 的通過率與學生通過率呈高度正相關(Spearman rho = 0.866),且 AI 難度指數與學生通過率呈強負相關。

  2. 2

    在 79 個程式題目測試中,AI 評估的難度與題目層級的學生通過率(rho = -0.871)及未嘗試率(rho = 0.800)皆有顯著相關。

  3. 3

    在入門級課程(CS101)中,AI 難度與學生表現的相關性大幅下降,顯示學生群體的組成差異會主導考試結果,而非題目難度。

  4. 4

    研究強調 AI 難度量表僅能作為外部參考,絕對不能用於個別學生的評分或自動調整成績。

對教育工作者的啟發

教育工作者在設計平行班級(Parallel Classes)的程式考試時,可利用 LLM 預先進行題目難度篩選,作為題目有效性的參考指標。然而,實務應用應遵循以下原則:首先,AI 僅能作為「輔助證據」用於討論公平性與追蹤品質,不可直接取代教師進行自動評分;其次,在設計入門級課程時,應更依賴學生實際表現而非 AI 預測;最後,必須建立審計機制(如記錄 API 調用與原始回應),以確保 AI 評估過程的可追溯性與透明度。

原始文獻資訊

英文標題:
From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations
作者:
Hongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。