意見眾多,模型各異:比較大型語言模型與傳統機器學習於開放式問卷分析之表現

arXiv - Computers and SocietyAbdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

研究發現 LLM 在分析開放式問卷的準確度優於傳統機器學習,但在一致性與解釋性方面存在挑戰。

AI 幫你先抓重點

AI 重點 1

精準度與解釋性之間的權衡(Trade-off)

滑鼠懸停看 AI 判斷理由
這改變了研究者對自動化工具的認知:雖然 AI 能更精準地「分類」,但它並不保證能提供穩定且邏輯一致的「理由」。在質性研究中,若無法理解 AI 判斷的邏輯,研究的嚴謹性將受到質疑。
AI 重點 2

從「分類工具」轉向「解釋工具」的思辨

滑鼠懸停看 AI 判斷理由
研究提醒我們,使用 LLM 不應僅追求自動化分類的結果,更需關注其判斷過程的透明度。這對於需要高度解釋力的教育研究(如學生反饋分析)至關重要,避免盲目信任黑箱模型。

核心研究發現

  1. 1

    在情緒分析與主題分類任務中,GPT、LLaMA 等大型語言模型(LLMs)的分類準確度普遍優於傳統機器學習模型。

  2. 2

    LLM 在理解學生回覆中複雜的情緒與主題模式方面展現出更強的優勢。

  3. 3

    儘管準確度較高,但 LLM 在預測理由的明確性、一致性以及類別邊界的應用上,與傳統模型存在顯著差異。

對教育工作者的啟發

對於需要處理大量學生反饋(如課程評鑑、學習歷程回饋)的研究者,建議採取「混合式分析策略」。首先利用 LLM 進行大規模的主題與情緒初步篩選,以提升效率;但在進行深入的質性解讀時,必須人工介入審核 AI 的分類理由,並針對 AI 判斷模糊的邊界案例進行抽樣檢查,以確保研究的解釋力與嚴謹性,而非完全依賴 AI 的自動化輸出。

原始文獻資訊

英文標題:
So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis
作者:
Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。