當 AI 成為牧師:大型語言模型在神學分流與牧養指導中的基準測試

arXiv - Computers and SocietyAlex Chao

研究開發了 FMG-Bench 基準測試,用以評估 LLM 在基督教神學諮詢與牧養指導中的安全性與適當性。

AI 幫你先抓重點

AI 重點 1

AI 必須具備「識別自身局限性」並進行轉介的能力。

滑鼠懸停看 AI 判斷理由
在涉及信仰、心理或法律等高風險領域時,AI 的任務不只是提供答案,更重要的是判斷何時該將使用者轉介給人類專業人士,這關乎到倫理安全與生命安全。
AI 重點 2

指令策略對不同性質的問題具有不同的適用性。

滑鼠懸停看 AI 判斷理由
研究顯示「比較觀點」對次要教義問題有效,但在處理核心教義或緊急牧養情境時反而有害,這提醒開發者在設計 AI 互動邏輯時必須根據問題類型進行動態調整。

核心研究發現

  1. 1

    開發了 FMG-Bench,包含 120 個情境,用於評估模型在神學分流與牧養指導中的表現。

  2. 2

    使用結構化指令框架(structured harness)能使模型平均表現提升 3.96 分,且所有測試模型皆有進步。

  3. 3

    在安全性關鍵指標「升級適當性」上,結構化指令讓模型識別臨床、法律或緊急支援需求的能力提升了 10.8 分。

  4. 4

    引導式設定提升了模型的穩健性,使面對問題改寫或壓力測試時的穩定性從 92.88 提升至 98.02。

對教育工作者的啟發

對於開發具備諮詢性質的 AI 系統(如教育輔導或心理支持),不應僅追求知識的完整性,更應建立「分流機制(Triage)」。開發者應設計結構化指令,訓練模型識別問題的風險等級,並在遇到法律、臨床或緊急狀況時,優先執行「轉介人類專家」的動作。此外,應針對不同性質的問題(如事實性知識 vs. 價值觀判斷)設計差異化的回應策略,以確保在處理敏感議題時的穩健性與安全性。

原始文獻資訊

英文標題:
When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models
作者:
Alex Chao
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。