衡量部分得分差距:越南 2025 年凸性評分制度的嚴格基準測試

arXiv - Computers and SocietyNguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

研究指出傳統 AI 評分準確度會因忽略非線性評分制度,而高估模型在特定考試中的實際能力。

AI 幫你先抓重點

AI 重點 1

評分指標的「非線性」特性會導致 AI 能力評估的系統性偏差。

滑鼠懸停看 AI 判斷理由
目前的 AI 基準測試多假設「答對越多分數越高」的線性邏輯,但現實教育評量(如凸性評分)往往會懲罰部分正確的行為。若不考慮評分規則,我們對 AI 知識掌握程度的判斷將會產生誤導性的樂觀。
AI 重點 2

錯誤的分布模式比單純的正確率更能決定最終成績。

滑鼠懸停看 AI 判斷理由
研究發現即使正確率相同,錯誤選項的組合方式也會導致得分大幅波動。這提醒研究者在設計 AI 評量工具時,必須考慮錯誤的結構與分佈,而非僅僅關注正確率(Accuracy)這一單一維度。

核心研究發現

  1. 1

    越南 2025 年高中畢業考採用凸性評分(Convex Marking),正確選項數與得分並非線性比例,例如答對 3 題僅得 0.5 分而非 0.75 分。

  2. 2

    研究開發了 THPT-Ladder 基準測試,包含 11 科 632 題,並根據越南官方評分標準進行評分,而非僅計算正確率。

  3. 3

    測試顯示 8 種模型在每題得分上,官方評分比傳統比例得分低 0.020 至 0.159 分,這會顯著改變模型的百分位排名。

  4. 4

    以 Qwen3.5-27B 為例,若考慮官方評分制度,其在歷史科的表現排名會從前 10%(第 90 百分位)降至前 23%(第 77 百分位)。

對教育工作者的啟發

教育科技開發者在設計 AI 評量系統時,不應僅依賴簡單的「對/錯」二元評分,必須將特定考試的評分邏輯(如凸性評分或懲罰機制)整合進評估模型中。對於課程設計者而言,這強調了「知識結構」的重要性:在某些評量制度下,掌握完整概念比僅掌握部分碎片化知識更具備競爭力。因此,AI 輔助學習工具應引導學生追求知識的完整性,而非僅僅追求答對部分題目。

原始文獻資訊

英文標題:
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme
作者:
Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。