識別個性化生成式 AI 傷害:需以用戶為中心進行互動層級審計

arXiv - Computers and SocietyHannah Cha

本文主張應將生成式 AI 的傷害審計從靜態評估轉向以用戶與社群為中心、具備適應性的互動式過程。

AI 幫你先抓重點

AI 重點 1

傷害的定義應被視為一種「動態且多元」的過程,而非預設的標準。

滑鼠懸停看 AI 判斷理由
這挑戰了開發者試圖建立「單一安全標準」的思維。在個性化 AI 環境中,傷害的感知高度依賴個人脈絡,理解這一點能引導設計者開發更具包容性的監測機制。
AI 重點 2

審計重心應從「事後評估」轉向「支持持續表達的基礎設施」。

滑鼠懸停看 AI 判斷理由
這改變了 AI 安全治理的範式,從單純的技術檢測轉向建立一種讓用戶能在互動過程中即時回饋與定義傷害的系統架構,對於建立信任至關重要。

核心研究發現

  1. 1

    現有的 AI 傷害審計方法過於依賴靜態模擬與預設定義,難以捕捉個性化系統中隨用戶互動歷史而演變的突發性傷害。

  2. 2

    傳統審計範式存在三大錯誤假設:傷害可在互動外預設、傷害定義缺乏多元性,以及傷害是靜態不變的。

  3. 3

    若試圖透過深度個性化來學習用戶對傷害的定義,可能會對邊緣化群體造成不對稱的勞動負擔與隱私風險。

對教育工作者的啟發

對於教育科技設計者而言,當開發具備個性化功能的 AI 教學助手時,不應僅依賴標準化的安全測試集。建議在產品設計中加入「動態回饋機制」,讓學生或教師能針對 AI 的回應(如偏見、不當引導)進行即時標記與定義。此外,設計者需警惕「過度個性化」帶來的隱私風險,特別是針對弱勢學生群體,應避免要求他們為了獲得更精準的 AI 體驗而被迫承擔過高的隱私揭露成本,應建立更具彈性且尊重多元價值的安全防護層。

原始文獻資訊

英文標題:
Identifying Harm in Personalized, Generative AI Systems Requires User-Centered Auditing at the Interaction Level
作者:
Hannah Cha
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。