LessonBench-V1:評估 AI 教案生成代理的基準數據集

arXiv - Computers and SocietyRavidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

本文推出 LessonBench-V1 基準數據集,透過結合教育理論與高品質 STEM 教材,系統化評估 AI 生成教案的能力。

AI 幫你先抓重點

AI 重點 1

將教育學理論(如 5E 模型)與 AI 評估標準進行深度整合。

滑鼠懸停看 AI 判斷理由
這解決了目前 AI 生成內容僅追求語言流暢度,而忽略教學邏輯與教育科學嚴謹性的問題,為 AI 教學設計提供了科學化的衡量標準。
AI 重點 2

透過「反向工程」方法建立高品質的基準測試。

滑鼠懸停看 AI 判斷理由
利用現有的優質教學內容反向推導教案,能確保基準測試的「標準答案」具備高度的教學專業性,而非僅依賴 AI 自我生成的內容。

核心研究發現

  1. 1

    開發了 LessonBench-V1 數據集,包含 647 份人類撰寫的課程與對應的 LLM 反向工程教案,涵蓋 240 個 STEM 主題。

  2. 2

    教案設計整合了布魯姆分類學、加涅教學事件、梅里爾首要原理及 5E 教學模型等教育學理論。

  3. 3

    數據集包含 3,620 個帶有教學元數據的學習目標,並提出一個三維度的評估流程,以實現可重複的 AI 評估。

對教育工作者的啟發

對於課程設計者而言,這項研究強調了「教學理論」在 AI 時代的重要性。開發 AI 教學工具時,不應僅關注內容的正確性,更應將布魯姆分類學或 5E 模型等結構化框架納入演算法的評估指標中。實務工作者可以參考此研究提出的三維度評估框架,來檢視 AI 生成的教學資源是否真正符合教學目標與學習者的認知發展需求,而非僅僅是文字的堆砌。

原始文獻資訊

英文標題:
LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents
作者:
Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。