語言模型在神經發展障礙評估中複製人類的還原論偏誤與決策不一致性

arXiv - Computers and SocietyMaciej Wodzi\'nski, Joanna Wodzi\'nska, Kacper Dudzic, Marcin Moskalewicz

研究發現大型語言模型在神經發展障礙評估中,雖展現高智識謙遜,卻與人類專家一樣存在決策不一致與還原論式的觀念偏誤。

AI 幫你先抓重點

AI 重點 1

警惕 AI 表現出的「虛假謙遜」現象

滑鼠懸停看 AI 判斷理由
LLM 雖然在語意上表現出高度的智識謙遜,但這種表象並未轉化為決策品質的提升。這提醒我們在評估 AI 輔助決策系統時,不能僅依賴其自我修正或謙遜的語氣,必須深入檢視其底層邏輯與決策的一致性。
AI 重點 2

關注 AI 對核心概念的還原論式詮釋

滑鼠懸停看 AI 判斷理由
AI 可能會將複雜的人類需求(如社交需求)簡化為生物性的生存需求。這種還原論傾向會導致評估結果偏向生物醫學模式,忽略了神經多樣性中重要的社會與溝通維度,進而影響支持資源的分配公平性。

核心研究發現

  1. 1

    人類專家與 LLM 在評估患者功能水平與最終支持資格決策之間皆存在不一致性,描述性評估與價值判斷未能有效連結。

  2. 2

    LLM 表現出比人類專家更高的智識謙遜(Intellectual Humility),但這種謙遜感與其決策的一致性或功能評估能力並無關聯。

  3. 3

    LLM 與醫師傾向於較少提供支持,且在解釋「基本生活需求」時,傾向於生物生存與自我照護,而非社交與溝通需求。

  4. 4

    研究顯示 LLM 與人類專家在面對錨定效應與代表性啟發式偏誤的實驗操縱時,皆未表現出顯著的易感性。

對教育工作者的啟發

對於開發教育或醫療輔助 AI 的設計者而言,本研究提供了重要啟發:首先,在設計高風險決策支持系統時,不應僅追求準確度或對抗認知偏誤,更需審視 AI 對核心概念(如「需求」或「能力」)的定義是否過於狹隘。其次,在評估 AI 的可靠性時,應建立「概念一致性」的檢驗機制,確保 AI 的描述性評估能邏輯一致地導向價值判斷。最後,在特殊教育與神經多樣性的應用場景中,應刻意引入社會與溝通維度的評估指標,以防止 AI 產生過於生物還原論的偏誤,確保支持資源能真正滿足學習者的多元需求。

原始文獻資訊

英文標題:
Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment
作者:
Maciej Wodzi\'nski, Joanna Wodzi\'nska, Kacper Dudzic, Marcin Moskalewicz
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。