相同的資訊,不同的更新:推論設定如何影響 LLM 在醫療分配中的行為

arXiv - Human-Computer InteractionSpencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz

研究發現 LLM 在處理醫療資源分配時,其決策會因上下文是否包含先前的回應而產生截然不同的機率偏移。

AI 幫你先抓重點

AI 重點 1

模型決策具備高度的「上下文依賴性」與不一致性

滑鼠懸停看 AI 判斷理由
這挑戰了開發者對 LLM 邏輯穩定性的認知。這意味著模型並非僅僅根據當前輸入做判斷,其過去的輸出紀錄會形成一種「路徑依賴」,導致在處理相同事實時產生矛盾的決策。
AI 重點 2

上下文工程(Context Engineering)在敏感決策中至關重要

滑鼠懸停看 AI 判斷理由
這提醒實務工作者,在將 AI 導入醫療或教育等高風險領域時,不能只關注單次提示詞(Prompt)的設計,必須嚴格管控對話歷史的累積方式,以避免模型行為失控。

核心研究發現

  1. 1

    在醫療資源分配實驗中,當加入新的對比資訊時,模型在「配對上下文」與「獨立推論」模式下的機率變化方向往往相反。

  2. 2

    測試的四個模型中有三個表現出這種現象,顯示模型決策會受到先前對話歷史(Context accumulation)的顯著影響。

  3. 3

    研究證實了患者資訊在敏感醫療決策中的上下文依賴性,即模型對新資訊的反應取決於其是否已處理過相關情境。

對教育工作者的啟發

雖然此研究聚焦於醫療領域,但對教育科技開發者有重要啟發:在設計 AI 導師或自動評分系統時,必須意識到「對話歷史」會深刻影響 AI 的判斷邏輯。若 AI 曾對學生給予特定評價,後續的評分可能會受到該歷史紀錄的干擾,而非僅根據當前作業內容。建議在開發教育 AI 時,應建立「上下文清理」或「狀態重置」機制,確保 AI 在進行關鍵評量時,能保持判斷的一致性與公平性,避免因先前的互動紀錄導致偏見的累積。

原始文獻資訊

英文標題:
Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation
作者:
Spencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。