超越最佳猜測:利用演化策略提升大型語言模型的解題覆蓋率

arXiv - Artificial IntelligenceConor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

研究發現使用演化策略(ES)進行後訓練,能比強化學習(RL)提供更廣的解題分布與更高的解題覆蓋率。

AI 幫你先抓重點

AI 重點 1

從「尋求單一正確答案」轉向「探索解題空間」的範式轉移

滑鼠懸停看 AI 判斷理由
這改變了我們對 AI 能力的評估標準。過去我們關注模型給出正確答案的機率,但這項研究指出,讓模型具備探索多種可能路徑的能力(即提高 pass@k),對於解決科學與數學等探索性問題至關重要。
AI 重點 2

演化策略(ES)在維持模型多樣性上的優勢

滑鼠懸停看 AI 判斷理由
這對於開發具備創造力或多維思考能力的 AI 系統具有啟發意義。理解 RL 可能會導致模型「過度收斂」而喪失思考廣度,能幫助開發者在設計教學輔助工具時,更謹慎地選擇訓練方法,以避免 AI 變得過於單一化。

核心研究發現

  1. 1

    傳統強化學習(RL)在後訓練過程中會使模型輸出分布收斂,導致解題覆蓋率(pass@k)下降。

  2. 2

    演化策略(ES)透過權重空間的隨機擾動進行優化,能產生比 RL 更廣泛且多樣化的輸出分布。

  3. 3

    在數學基準測試中,具備更高解題覆蓋率的模型表現出更優異的最終結果。

對教育工作者的啟發

對於開發 AI 輔助學習工具(如數學解題助手)的設計者而言,這項研究提醒我們,不應僅追求模型給出「最可能」的答案,而應致力於提升模型提供「多樣化解題路徑」的能力。在設計學習系統時,可以利用這種高覆蓋率的特性,讓 AI 為學生提供多種不同的思考角度或解題策略,而非僅僅給出標準答案,從而支持更深層次的知識建構與問題解決能力的培養。

原始文獻資訊

英文標題:
Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
作者:
Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu
來源:
arXiv - Artificial Intelligence
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。