生成式 AI 時代的評量設計:測試 AI 素養與學習成效的 X1-X2-X3 模式
arXiv - Computers and SocietyRiasat Islam (School of Electronic Engineering and Computer Science, Queen Mary University of London, London, United Kingdom), Thomas Roelleke (School of Electronic Engineering and Computer Science, Queen Mary University of London, London, United Kingdom)
本文提出一種 X1-X2-X3 評量設計模式,透過要求學生對比、產出與評估 AI 回答,來強化 AI 素養與評量效度。
AI 幫你先抓重點
AI 重點 1
從「懲罰作弊」轉向「測試 AI 素養」的評量範式轉移。
滑鼠懸停看 AI 判斷理由
傳統評量試圖禁止 AI 使用,但在技術領域這已極其困難。此研究強調將 AI 納入評量設計,測試學生如何與 AI 協作與批判,這能更符合未來職場的真實需求。
AI 重點 2
設計評量時應將 GenAI 作為「壓力測試」的對象。
滑鼠懸停看 AI 判斷理由
這改變了教師準備教材的邏輯。教師不應只思考題目難度,更應思考「AI 能否輕易答對此題」,透過模擬 AI 的表現來優化題目,確保評量能真正測出學生的深度理解。
核心研究發現
- 1
開發出 X1-X2-X3 三段式回應格式:要求學生先記錄來源答案(X1)、產出個人答案(X2),最後評估來源輸出(X3)。
- 2
採用 AI 覺察的題目設計流程,在正式實施前先利用當前生成式 AI 工具進行壓力測試,並針對能被簡單提示詞解決的題目進行修改。
- 3
該模式能支持真實性評量(Authentic Assessment),使學生的 AI 素養、判斷力以及評分過程變得更加透明且可見。
對教育工作者的啟發
教育工作者在面對 GenAI 挑戰時,不應僅專注於防範學生的不當行為,而應重新設計評量結構。建議採用「對比與評估」的策略,例如要求學生不僅要給出答案,還要能批判性地分析 AI 給出的答案是否正確。此外,在設計題目時,應先自行使用 GenAI 進行測試,若發現題目能被簡單的提示詞(Prompt)直接解決,則需增加題目深度或改變任務類型,以確保評量能有效區分學生的真實能力與 AI 的生成能力。
原始文獻資訊
- 英文標題:
- Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection
- 作者:
- Riasat Islam (School of Electronic Engineering and Computer Science, Queen Mary University of London, London, United Kingdom), Thomas Roelleke (School of Electronic Engineering and Computer Science, Queen Mary University of London, London, United Kingdom)
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。