大型語言模型在數學解題中面對表示法變動的魯棒性研究
arXiv - Human-Computer InteractionSagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera
研究發現 LLM 在處理數學問題時,即便問題邏輯相同,僅改變文字呈現方式(如從故事題變為方程式)仍會導致解題表現大幅波動。
AI 幫你先抓重點
AI 重點 1
「表示法」應被視為 AI 介面設計的首要變數
滑鼠懸停看 AI 判斷理由
這改變了我們對 AI 評估的認知。過去我們認為只要邏輯正確,問題怎麼問都一樣;但研究證明,問題的「包裝方式」會直接影響 AI 的推理品質,這對設計 AI 輔助教學工具至關重要。
AI 重點 2
工具輔助(如程式碼執行)並非萬靈丹
滑鼠懸停看 AI 判斷理由
這提醒開發者與教育者,單純增加技術層面的「推理支架」可能只是將錯誤從「邏輯錯誤」轉移到「技術執行錯誤」,並不能從根本上解決模型對語意表達的敏感度問題。
核心研究發現
- 1
模型展現出顯著的表示法敏感性,當數學問題在故事題、符號方程式與文字方程式之間轉換時,正確率會出現大幅度的波動。
- 2
即便僅是進行同義詞的改寫(isomorphic paraphrases),也會導致模型表現下降,顯示模型對微小的語意變化極其脆弱。
- 3
引入 Python 程式碼輔助推理雖能釋放部分潛在推理能力,但無法消除表示法的脆弱性,且會產生新的錯誤類型,如協定違規或執行失敗。
- 4
研究指出推理支架(reasoning scaffolds)並未解決表示法不穩定的問題,反而是在正確性、可靠性、延遲與成本之間產生了新的權衡。
對教育工作者的啟發
對於設計 AI 輔助數學學習系統的開發者而言,不應僅依賴單一的問題呈現方式。在設計自動化評量或教學引導工具時,必須考慮到「問題表述的多樣性」可能導致 AI 判斷不一致。建議在開發過程中,應針對同一數學概念設計多種不同表述形式(如文字敘述與符號化)的測試集,以確保 AI 系統的穩定性。此外,在使用程式碼輔助推理(Code-augmented reasoning)時,需預留處理執行錯誤與協定錯誤的機制,而非僅關注邏輯正確性。
原始文獻資訊
- 英文標題:
- Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving
- 作者:
- Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera
- 來源:
- arXiv - Human-Computer Interaction
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。