用於多語言數學推理的在策略 Delta 蒸餾技術研究

arXiv - Computation and LanguageByeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

研究提出 OPD² 技術,透過強化教師模型與基礎模型間的機率差距,提升大語言模型的多語言數學推理能力。

AI 幫你先抓重點

AI 重點 1

利用「機率差距」作為學習訊號的優勢

滑鼠懸停看 AI 判斷理由
這改變了傳統蒸餾僅關注教師輸出結果的思維,透過捕捉模型演進的細微變化(Delta),能更精準地引導模型學習複雜的邏輯推理,而非僅是模仿文本。
AI 重點 2

多語言數據對於保留目標語言特性的必要性

滑鼠懸停看 AI 判斷理由
這提醒開發者在進行模型優化時,單一語言的強化可能導致「語言漂移」現象,若要維持教學工具的多語言適用性,必須在訓練中平衡語言多樣性。

核心研究發現

  1. 1

    研究發現 OPD² 技術在數學推理任務上表現優於傳統的 OPD,特別是在韓語與日語的表現提升顯著。

  2. 2

    OPD² 有效縮小了模型在英語與韓語之間的性能差距,增強了跨語言的推理一致性。

  3. 3

    僅使用英語數據進行 OPD 雖能提升韓語與日語表現,但會導致模型回覆傾向於使用英語,而非目標語言。

對教育工作者的啟發

對於開發全球化教育 AI 工具的設計者而言,此研究強調了「語言多樣性」在模型微調階段的重要性。若目標是開發能支援多國語言的數學輔助學習系統,不能僅依賴英語數據進行強化,否則會導致模型在非英語環境下的語言表達能力退化。建議在進行模型優化時,應整合目標語言的數據,以確保 AI 在提供邏輯推理支援的同時,能以使用者熟悉的母語進行自然且準確的互動。

原始文獻資訊

英文標題:
On-Policy Delta Distillation for Multilingual Math Reasoning
作者:
Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
來源:
arXiv - Computation and Language
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。