防範單一模型漏洞:法律選擇題基準測試中的選項僅依賴解題能力研究
arXiv - Computers and SocietyVolodymyr Ovcharov
研究發現 AI 在法律選擇題測試中存在「僅靠選項即可解題」的漏洞,導致評分結果可能高估模型能力。
AI 幫你先抓重點
AI 重點 1
警惕 AI 評測中的「捷徑學習」現象
滑鼠懸停看 AI 判斷理由
這改變了我們對 AI 能力評估的認知。目前的基準測試可能並非在測驗模型的邏輯推理,而是在測驗其對特定格式或選項分佈的統計偏好,這會導致開發者誤以為模型已具備專業知識。
AI 重點 2
題目設計的結構性風險
滑鼠懸停看 AI 判斷理由
研究顯示題目格式(如選項長度、干擾項設計)會直接影響 AI 是否能「作弊」。這提醒教育科技開發者,在設計自動化評量系統時,必須嚴格控制選項的結構,以確保測驗的是真實能力而非模式識別。
核心研究發現
- 1
研究發現 Claude Haiku 4.5 在不看題目僅看選項時,得分高於隨機機率,且有 11.8% 的題目在所有選項順序下皆能盲猜成功。
- 2
部分模型(如 Llama 3.1 8B)因具有強烈的選項位置偏好(如 92% 選 A),導致其在基準測試中的排名被嚴重誤導。
- 3
透過「門檻模型」過濾掉可僅靠選項解題的題目後,GPT-5.6 等模型在剩餘題目上的表現仍顯著優於隨機機率。
- 4
研究指出題目格式(如干擾項長度與內容)是導致此漏洞的主因,若干擾項與題幹關聯性強,則漏洞會減少。
對教育工作者的啟發
對於開發 AI 自動化評量工具的教育科技人員,本研究提供了重要的設計警示:首先,在設計選擇題時,應避免選項長度或內容與題幹呈現過度相關的模式,以防止模型透過統計規律「猜中」答案;其次,在驗證 AI 模型的專業知識(如法律、醫學)時,必須加入「選項盲測」機制,確保模型是基於理解題意而非僅依賴選項特徵來解題;最後,應建立更嚴謹的基準測試流程,排除掉那些僅靠選項分佈即可解題的「低質量題目」,以獲得更真實的模型能力評估。
原始文獻資訊
- 英文標題:
- Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
- 作者:
- Volodymyr Ovcharov
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。