WrAFT:用於議論文自動評分與回饋的模組化系統

arXiv - Artificial IntelligenceAdnan Labib, Yixuan Huang, Jiahui Wu, John Maurice Gayed, Zheng Yuan, Qiao Wang

開發了一套名為 WrAFT 的模組化自動寫作評估系統,能針對議論文提供高準確度的評分與多層次回饋。

AI 幫你先抓重點

AI 重點 1

模組化設計是提升自動寫作評估(AWE)品質的關鍵策略。

滑鼠懸停看 AI 判斷理由
將寫作評估拆解為評分、表面回饋與深度回饋三個獨立模組,能有效解決傳統 AI 寫作工具僅能給予模糊分數、缺乏具體指導的痛點,實現更精準的教學介入。
AI 重點 2

大型語言模型(LLMs)在寫作評估中展現出極高的教學潛力。

滑鼠懸停看 AI 判斷理由
透過對 LLaMA-3.3、GPT-4o 與 Claude 3.7 的測試,證明了結合直接提示(prompting)與監督式微調(fine-tuning)能讓 AI 提供接近人類水準的深度邏輯回饋,而非僅是語法檢查。

核心研究發現

  1. 1

    WrAFT 在議論文評分表現上達到頂尖水準,其 QWK 指標達 0.84,RMSE 為 0.44(以 0-5 分制計算)。

  2. 2

    系統生成的表面層級回饋獲得 96.14% 的人類認可度,顯示其在語言細節修正上的有效性。

  3. 3

    深度層級的回饋表現優異,宏觀回饋(macro feedback)與微觀回饋(micro feedback)的人類認可度分別達 93.03% 與 94.69%。

對教育工作者的啟發

教育工作者可借鑒其「分層回饋」的概念:在數位學習環境中,不應只給予總分,應將回饋分為「語法與拼字(表面層級)」以及「邏輯與結構(深度層級)」。這種做法能幫助學生進行更有效的自主學習(SRL),讓學生能針對不同層次的寫作問題進行有目的性的修正,而非僅僅是被動接受分數。

原始文獻資訊

英文標題:
WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays
作者:
Adnan Labib, Yixuan Huang, Jiahui Wu, John Maurice Gayed, Zheng Yuan, Qiao Wang
來源:
arXiv - Artificial Intelligence
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。