CARE-MH:邁向心理健康大型語言模型統一、可重複且具可比性的評估框架

arXiv - Human-Computer InteractionAsher Sprigler, Yixue Zhao, Yi Ding

提出 CARE-MH 框架以解決心理健康 LLM 評估中缺乏一致性、難以重複與難以比較的問題。

AI 幫你先抓重點

AI 重點 1

標準化評估配置與共享指標定義的迫切需求

滑鼠懸停看 AI 判斷理由
在心理健康這種高風險領域,若評估標準不統一,開發者將無法準確判斷模型是否安全或具備同理心,這會阻礙技術在臨床或輔導實務中的安全落地。
AI 重點 2

區分「模型不穩定」與「指標定義差異」的影響

滑鼠懸停看 AI 判斷理由
理解這兩者的差異有助於研究者判斷問題出在模型本身的隨機性,還是評估工具本身的設計缺陷,從而進行更有針對性的優化。

核心研究發現

  1. 1

    現有的心理健康基準測試因評估設計與指標定義不一致,導致結果難以進行跨研究的重複性驗證與比較。

  2. 2

    研究發現模型穩定性是影響評估結果能否成功重複的重要因素,直接影響了測試結果的可靠性。

  3. 3

    不同基準測試之間的結果分歧,主要源於各研究對評估指標定義的差異,而非僅僅是模型性能問題。

對教育工作者的啟發

對於開發心理健康輔助工具的團隊而言,不應僅追求單一基準測試的高分,而應建立一套標準化的評估流程。建議在開發過程中,同時採用多維度的指標(如安全性、同理心、治療適當性),並確保評估環境的可重複性,以確保 AI 在面對使用者情緒需求時,其表現是穩定且符合臨床倫理規範的。

原始文獻資訊

英文標題:
CARE-MH: Towards Unified, Reproducible, and Comparable Evaluation of Mental Health LLMs
作者:
Asher Sprigler, Yixue Zhao, Yi Ding
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。