透過層次化推理與語句級目標獎勵提升大型語言模型的社交智能

arXiv - Computation and LanguageXiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

提出 TSR 框架與 LHRL-VGR 演算法,透過層次化規劃與動態獎勵機制提升 LLM 在社交協商任務中的表現。

AI 幫你先抓重點

AI 重點 1

從「單一目標獎勵」轉向「層次化目標管理」的思維轉變。

滑鼠懸停看 AI 判斷理由
傳統方法對每句話給予相同權重的獎勵會忽略對話的動態性。這種層次化結構模擬了人類的認知過程,對於開發具備長期規劃能力的 AI 代理人至關重要。
AI 重點 2

引入變異門控獎勵(Variance-Gated Rewards)來優化強化學習。

滑鼠懸停看 AI 判斷理由
這解決了強化學習中獎勵信號不穩定的問題。透過動態調整獎勵路徑,AI 能更精準地學習何時該專注於達成目標,何時該專注於維持溝通策略。

核心研究發現

  1. 1

    提出 Think-Strategy-Response (TSR) 框架,將社交對話分解為高層次策略規劃與低層次語言執行兩個階段。

  2. 2

    開發出 LHRL-VGR 演算法,能根據目標達成分數的變異量動態分配獎勵,平衡目標完成度與策略一致性。

  3. 3

    在 SOTOPIA 基準測試中,經微調的 Qwen2.5-7B 模型在目標完成成功率上超越 GPT-4o 達 7.32%。

對教育工作者的啟發

雖然此研究聚焦於 AI 技術,但其「層次化規劃」與「動態獎勵」的概念對教育設計有啟發。在設計 AI 輔助學習系統(如 AI 導師)時,不應僅針對最終學習結果給予獎勵,而應模仿 TSR 框架,將學習過程拆解為「高層次的學習策略規劃」與「低層次的具體執行步驟」,並根據學習者在不同階段的表現(變異量)動態調整回饋機制,以支持更精準的自主學習(SRL)。

原始文獻資訊

英文標題:
Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding
作者:
Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen
來源:
arXiv - Computation and Language
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。