對齊 LLM 模擬考生與人類考生:一種認知診斷剖析的心理計量校準方法

arXiv - Computers and SocietyWenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

提出 CDP 框架,透過模擬多樣化的認知剖析,提升 LLM 模擬考生在心理計量校準上與人類考生的對齊度。

AI 幫你先抓重點

AI 重點 1

解決 LLM 模擬考生「過於精準且過於一致」的侷限性

滑鼠懸停看 AI 判斷理由
傳統 LLM 在模擬測試時往往表現得太過完美,導致數據缺乏變異性,無法反映真實學生的能力差異。此研究透過 CDP 引入認知剖析,讓模擬數據具備真實世界的複雜度,這對於開發低成本的測試校準工具至關重要。
AI 重點 2

認知診斷剖析(CDP)作為零樣本(Zero-shot)框架的應用潛力

滑鼠懸停看 AI 判斷理由
這項技術不需要大量的人類標籤數據即可運作,展示了如何利用 LLM 的推理能力來模擬特定的學習狀態,為教育評量工具的早期開發與迭代提供了自動化的新路徑。

核心研究發現

  1. 1

    CDP 框架顯著提升了 LLM 在能力分佈、掌握剖析及題目難度三個層級與人類考生的對齊程度。

  2. 2

    在剖析層級,CDP 讓 LLM 模擬的剖析分數與人類預期之間的加權相關係數達到 0.92 至 0.98 之間。

  3. 3

    在題目難度恢復方面,使用 Gemini 3.0 Flash (Thinking) 時,Spearman 相關係數從 0.24 大幅提升至 0.86 至 0.90。

  4. 4

    研究證實,透過提供資訊性的認知剖析(Informative-CDP),能更有效地提升模擬考生的心理計量一致性。

對教育工作者的啟發

對於開發數位評量系統的設計者而言,這項研究提供了一種利用 LLM 進行「預測試」的新策略。在正式投入昂貴的人類大規模測試前,設計者可以利用 CDP 框架,透過設定不同的認知剖析(例如:部分掌握、特定技能缺失等),來模擬各種學習者特徵,藉此預先校準題目難度與評量工具的有效性。這不僅能大幅降低測試開發的成本,還能透過模擬不同程度的學生,幫助設計者在產品上線前優化題目結構與難度分佈,確保評量工具的科學性與公平性。

原始文獻資訊

英文標題:
Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach
作者:
Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。