價值漂移:追蹤大型語言模型後訓練過程中的價值對齊
arXiv - Computers and SocietyMehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Sta\'nczak, Vered Shwartz, Siva Reddy
研究發現模型價值主要在 SFT 階段確立,後續偏好優化難以改變已形成的價值觀。
AI 幫你先抓重點
AI 重點 1
價值觀的「關鍵期」在於模型訓練的早期階段
滑鼠懸停看 AI 判斷理由
這改變了開發者對模型對齊的認知。過去可能認為偏好優化是調整價值的主要手段,但研究顯示 SFT 才是決定性的時刻,這意味著數據清洗與初期微調的品質比後期的優化更為關鍵。
AI 重點 2
演算法本身具備強大的價值塑造能力
滑鼠懸停看 AI 判斷理由
這提醒研究者,僅僅依賴數據是不夠的。演算法的選擇會干預模型如何解讀價值,這在開發具備特定倫理準則的教育 AI 時,必須將演算法選擇納入風險評估。
核心研究發現
- 1
研究指出 SFT(監督式微調)階段通常會奠定模型的價值觀基礎,而隨後的偏好優化階段則極少能重新對齊這些價值。
- 2
實驗發現不同的偏好優化演算法,即使在面對相同的偏好數據集時,也會導致截然不同的價值對齊結果。
- 3
透過對 Llama-3 與 Qwen-3 不同規模模型的測試,研究成功分離出後訓練演算法與數據集對價值漂移幅度的影響。
對教育工作者的啟發
對於開發教育用 AI 的實務者而言,這項研究提供了兩點重要啟發:首先,在設計旨在傳遞特定價值觀(如批判性思考、包容性教育)的 AI 模型時,應將重心放在 SFT 階段的高品質數據策劃,而非僅寄望於後期的偏好優化。其次,在選擇模型架構時,必須意識到演算法本身會帶入偏見,因此在將 AI 導入教室前,應針對特定演算法在教育價值觀上的表現進行嚴格的壓力測試與對齊評估,以確保 AI 的價值觀與教學目標一致。
原始文獻資訊
- 英文標題:
- Value Drifts: Tracing Value Alignment During LLM Post-Training
- 作者:
- Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Sta\'nczak, Vered Shwartz, Siva Reddy
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。