衡量部分得分差距:越南 2025 年凸性評分制度的嚴格基準測試
arXiv - Computers and SocietyNguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh
研究指出傳統 AI 評分準確度會因忽略非線性評分制度,而高估模型在特定考試中的實際能力。
AI 幫你先抓重點
AI 重點 1
評分指標的「非線性」特性會導致 AI 能力評估的系統性偏差。
滑鼠懸停看 AI 判斷理由
目前的 AI 基準測試多假設「答對越多分數越高」的線性邏輯,但現實教育評量(如凸性評分)往往會懲罰部分正確的行為。若不考慮評分規則,我們對 AI 知識掌握程度的判斷將會產生誤導性的樂觀。
AI 重點 2
錯誤的分布模式比單純的正確率更能決定最終成績。
滑鼠懸停看 AI 判斷理由
研究發現即使正確率相同,錯誤選項的組合方式也會導致得分大幅波動。這提醒研究者在設計 AI 評量工具時,必須考慮錯誤的結構與分佈,而非僅僅關注正確率(Accuracy)這一單一維度。
核心研究發現
- 1
越南 2025 年高中畢業考採用凸性評分(Convex Marking),正確選項數與得分並非線性比例,例如答對 3 題僅得 0.5 分而非 0.75 分。
- 2
研究開發了 THPT-Ladder 基準測試,包含 11 科 632 題,並根據越南官方評分標準進行評分,而非僅計算正確率。
- 3
測試顯示 8 種模型在每題得分上,官方評分比傳統比例得分低 0.020 至 0.159 分,這會顯著改變模型的百分位排名。
- 4
以 Qwen3.5-27B 為例,若考慮官方評分制度,其在歷史科的表現排名會從前 10%(第 90 百分位)降至前 23%(第 77 百分位)。
對教育工作者的啟發
教育科技開發者在設計 AI 評量系統時,不應僅依賴簡單的「對/錯」二元評分,必須將特定考試的評分邏輯(如凸性評分或懲罰機制)整合進評估模型中。對於課程設計者而言,這強調了「知識結構」的重要性:在某些評量制度下,掌握完整概念比僅掌握部分碎片化知識更具備競爭力。因此,AI 輔助學習工具應引導學生追求知識的完整性,而非僅僅追求答對部分題目。
原始文獻資訊
- 英文標題:
- Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme
- 作者:
- Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。