超越「我無法處理」:兒童安全專家如何評估 AI 聊天機器人的安全性
arXiv - Computers and SocietyHannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan
研究透過訪談專業從業者,指出現行 AI 安全評估缺乏實務真實性,並提出應納入專家觀點的改進建議。
AI 幫你先抓重點
AI 重點 1
安全評估應從「偵測有害輸出」轉向「理解真實風險情境」
滑鼠懸停看 AI 判斷理由
目前的 AI 安全機制往往只在於防止機器人說出禁忌語,但對於青少年在情緒危機時,機器人給予「錯誤的安慰」或「不當的建議」可能造成更深層的傷害。這要求開發者必須將評估標準從技術層面提升至社會心理層面。
AI 重點 2
納入跨領域專業從業者的觀點是建立安全基礎設施的關鍵
滑鼠懸停看 AI 判斷理由
單純的工程師視角無法預見青少年在複雜社會環境中的心理需求。透過將社工與心理學家的實務經驗整合進 AI 訓練與評估流程,才能建立更具備社會敏感度且能真正保護青少年的 AI 系統。
核心研究發現
- 1
現有的 AI 安全評估過於依賴未經驗證的假設(如僅關注拒絕回答),且多聚焦於偵測對抗性提示或表面傷害,無法捕捉真實世界的風險。
- 2
透過訪談 19 位社工、心理師與心理學家,研究識別出聊天機器人可能導致傷害的行為,以及在困難時刻能提供實質支持的正向行為。
- 3
專家強調聊天機器人在與青少年互動時應扮演的角色界限,並針對如何改善機器人的回應機制提出了具體的實務建議。
對教育工作者的啟發
對於教育科技開發者與設計者,本研究提供了重要的警示:在設計面向青少年的 AI 工具時,不能僅滿足於「過濾有害詞彙」或「拒絕敏感問題」。實務上應建立一套包含心理學與社會工作專業視角的評估框架,模擬青少年在真實生活中的情緒危機情境,測試 AI 的回應是否具備適當的同理心與界限感。此外,教育者在引導學生使用 AI 時,也應意識到 AI 可能提供的「表面支持」與「實質傷害」之間的差異,並將此作為數位素養教育的一部分。
原始文獻資訊
- 英文標題:
- Beyond "I Can't Help With That": How Child Safety Experts Evaluate AI Chatbot Safety
- 作者:
- Hannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan
- 來源:
- arXiv - Computers and Society
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。