「我想被挑戰,我想成長」:賦能社工設計 LLM 增強工作的評估機制
arXiv - Human-Computer InteractionAnna Kawakami, Chloe Qianhui Zhao, Renee Shelby, Fernando Diaz, Haiyi Zhu, Kenneth Holstein
提出「勞工驅動的 AI 測量」方法,讓專業工作者主導定義 AI 增強工作的成功標準與評估指標。
AI 幫你先抓重點
AI 重點 1
從「由上而下」轉向「由下而上」的 AI 評估範式
滑鼠懸停看 AI 判斷理由
傳統 AI 評估多由開發者主導,忽略了實際使用者的需求。此研究證明讓專業工作者參與定義「什麼是成功的 AI 輔助」,能確保技術真正符合專業實務並具備實質價值。
AI 重點 2
將 AI 定位為「挑戰者」而非僅是「助手」
滑鼠懸停看 AI 判斷理由
這改變了對 AI 增強工作的認知。AI 不應只是自動化任務,更應能透過引發反思來提升人類的專業深度,這對於需要高度批判性思考的專業領域極具啟發。
核心研究發現
- 1
透過八場工作坊,19 名社工成功開發出能衡量 LLM 是否能挑戰其假設與偏見的評估基準。
- 2
工作者共同設計並精煉了「LLM 作為裁判」的評分量表,將其專業經驗轉化為評估準則。
- 3
驗證結果顯示,工作者建立的基準與 LLM 裁判的評分具有高度一致性,且能有效區分六種主流 LLM 的表現。
對教育工作者的啟發
對於教育科技設計者而言,開發 AI 工具時不應僅追求效率提升,應納入「專業反思」的維度。建議在設計 AI 輔助教學或專業工具時,應建立參與式設計流程,邀請使用者共同定義評估量表(Rubric),確保 AI 能在提供支援的同時,也能透過「挑戰性提問」促進使用者的元認知(Metacognition)與專業成長,而非僅僅是提供標準答案。
原始文獻資訊
- 英文標題:
- "I want to be pushed, I want to grow": Enabling social workers to design evaluations of LLM augmentation in their work
- 作者:
- Anna Kawakami, Chloe Qianhui Zhao, Renee Shelby, Fernando Diaz, Haiyi Zhu, Kenneth Holstein
- 來源:
- arXiv - Human-Computer Interaction
- AI 摘要模型:
- /models/gemma-4-26B-A4B-it
每週精選研究電子報
每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。