大型語言模型如何判斷社交吸引力?基於心理學理論的人格評分研究
arXiv - Computers and SocietyHasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David
研究證實 LLM 在評估社交吸引力時展現出與人類高度一致的排序能力,但在評分極端度上較人類更為激進。
AI 幫你先抓重點
AI 重點 1
LLM 可作為人類主觀判斷的可靠替代或輔助工具
滑鼠懸停看 AI 判斷理由
研究證明 LLM 在人格特質的層級排序上與人類高度同步,這意味著在需要大規模進行社會心理特質評估的場景中,LLM 能提供具備效度的自動化評分參考。
AI 重點 2
注意 AI 評分的「極端化」傾向
滑鼠懸停看 AI 判斷理由
雖然 LLM 的判斷邏輯與人類一致,但其評分尺度較為激進(更趨向極端高分或低分)。在將 AI 應用於社會科學研究或心理評估時,必須考慮這種偏差,避免過度放大特質差異。
核心研究發現
- 1
在多次重複測試中,34 個 LLM 模型展現出強大的評分穩定性,並能一致地將人格特質區分為吸引力高、中、低三層級。
- 2
研究發現 LLM 對性別呈現(姓名與代名詞)並不敏感,在不同性別組合的測試中未發現顯著的評分差異。
- 3
與 198 名人類受試者的比較顯示,LLM 的評分排序與人類一致,但 LLM 對吸引力人格給予更高分,對不具吸引力的人格給予更低分。
對教育工作者的啟發
對於開發教育科技或社交學習平台的設計者而言,此研究提供了重要啟發:若系統需要模擬人類對學習者社交特質(如協作能力、領導力)的感知,LLM 可作為有效的自動化評估引擎。然而,設計者應注意 LLM 可能會過度強化某些特質的表現,因此在設計自動化反饋系統時,應建立校準機制,確保 AI 的評分尺度能與人類的心理預期保持一致,避免因評分過於極端而導致學習者產生錯誤的自我認知。
原始文獻資訊
- 英文標題:
- How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans
- 作者:
- Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。