MateInfoUB:測試大型語言模型於競爭性、多語言及多模態教育任務之基準測試

arXiv - Computers and SocietyAdrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

本研究開發了一個包含英、羅雙語及多模態資訊的電腦科學競賽資料集,用以評估 LLM 在高階程式設計任務中的表現。

AI 幫你先抓重點

AI 重點 1

問題解決策略的雙軌性:推理 vs. 程式實作

滑鼠懸停看 AI 判斷理由
這項發現挑戰了「AI 萬能」的假設,指出在教育設計中必須區分哪些問題適合邏輯思考,哪些適合工具輔助,這對於設計有效的 AI 輔助學習環境至關重要。
AI 重點 2

語言偏誤對教育評量的潛在影響

滑鼠懸停看 AI 判斷理由
語言能力差異會直接影響 AI 評估的準確性,這提醒教育工作者在利用 AI 進行自動化評量或提供教學支援時,必須考慮語言資源不平等帶來的偏誤風險。

核心研究發現

  1. 1

    開發了 MateInfoUB 資料集,包含來自高階電腦科學競賽的多選題,涵蓋文本與圖像等多模態資訊。

  2. 2

    研究發現 LLM 在處理不同類型問題時表現不一:部分問題適合邏輯推理,部分則更適合透過撰寫程式碼來解決。

  3. 3

    實驗結果顯示語言選擇(英文與羅馬尼亞文)會顯著影響 LLM 在理論程式設計任務上的表現。

  4. 4

    研究同時探討了 LLM 在教育情境下對學術誠信與評量公平性所帶來的倫理挑戰。

對教育工作者的啟發

教育工作者在設計電腦科學課程時,應意識到 AI 在不同認知層次(如純理論推理與實作編碼)的表現差異。在設計評量工具時,不應僅依賴單一語言或單一模式,需考量多模態資訊對學習者的影響。此外,隨著 AI 融入競賽與課堂,應建立明確的倫理準則,以確保 AI 的使用不會損害學術誠信或造成語言弱勢學生的評量不公。最後,可利用類似的互動式應用程式來促進學生的自主學習與自我評量。

原始文獻資訊

英文標題:
MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks
作者:
Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。