大型語言模型在數學解題中面對表示法變動的魯棒性研究

arXiv - Human-Computer InteractionSagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

研究發現 LLM 在處理數學問題時,即便問題邏輯相同,僅改變文字呈現方式(如從故事題變為方程式)仍會導致解題表現大幅波動。

AI 幫你先抓重點

AI 重點 1

「表示法」應被視為 AI 介面設計的首要變數

滑鼠懸停看 AI 判斷理由
這改變了我們對 AI 評估的認知。過去我們認為只要邏輯正確,問題怎麼問都一樣;但研究證明,問題的「包裝方式」會直接影響 AI 的推理品質,這對設計 AI 輔助教學工具至關重要。
AI 重點 2

工具輔助(如程式碼執行)並非萬靈丹

滑鼠懸停看 AI 判斷理由
這提醒開發者與教育者,單純增加技術層面的「推理支架」可能只是將錯誤從「邏輯錯誤」轉移到「技術執行錯誤」,並不能從根本上解決模型對語意表達的敏感度問題。

核心研究發現

  1. 1

    模型展現出顯著的表示法敏感性,當數學問題在故事題、符號方程式與文字方程式之間轉換時,正確率會出現大幅度的波動。

  2. 2

    即便僅是進行同義詞的改寫(isomorphic paraphrases),也會導致模型表現下降,顯示模型對微小的語意變化極其脆弱。

  3. 3

    引入 Python 程式碼輔助推理雖能釋放部分潛在推理能力,但無法消除表示法的脆弱性,且會產生新的錯誤類型,如協定違規或執行失敗。

  4. 4

    研究指出推理支架(reasoning scaffolds)並未解決表示法不穩定的問題,反而是在正確性、可靠性、延遲與成本之間產生了新的權衡。

對教育工作者的啟發

對於設計 AI 輔助數學學習系統的開發者而言,不應僅依賴單一的問題呈現方式。在設計自動化評量或教學引導工具時,必須考慮到「問題表述的多樣性」可能導致 AI 判斷不一致。建議在開發過程中,應針對同一數學概念設計多種不同表述形式(如文字敘述與符號化)的測試集,以確保 AI 系統的穩定性。此外,在使用程式碼輔助推理(Code-augmented reasoning)時,需預留處理執行錯誤與協定錯誤的機制,而非僅關注邏輯正確性。

原始文獻資訊

英文標題:
Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving
作者:
Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。