不只是導航:評估具備解釋能力的輔助型 UI 代理人

arXiv - Human-Computer InteractionSantosh Patapati

本文提出 NeXUI 基準測試,旨在評估 AI 代理人在輔助視障用戶時,能否在執行任務的同時提供準確且具解釋性的操作說明。

AI 幫你先抓重點

AI 重點 1

從「工具型代理」轉向「協作型代理」的範式轉移

滑鼠懸停看 AI 判斷理由
過去開發 AI 僅追求自動化完成任務,但對於依賴輔助技術的用戶,若 AI 無法解釋其行為,用戶將失去對系統的信任與掌控。這改變了我們對 AI 輔助工具「成功」的定義。
AI 重點 2

解釋能力的「接地性」(Grounding)是關鍵指標

滑鼠懸停看 AI 判斷理由
僅僅會說話是不夠的,AI 的解釋必須與當前的介面狀態高度一致。若解釋與實際操作脫節,對於視障用戶而言不僅無助,反而會造成誤導與安全風險。

核心研究發現

  1. 1

    研究指出目前的 UI 代理人多以任務完成率為唯一指標,忽略了對視障用戶至關重要的「解釋能力」與「用戶掌控感」。

  2. 2

    新開發的 NeXUI 基準測試結合了真實用戶目標與介面狀態,要求代理人必須能根據視覺與結構資訊進行推理並解釋步驟。

  3. 3

    實驗顯示現有頂尖模型表現不佳,例如 Gemini-1.5-Flash 的任務成功率僅 44%,且其提供的解釋分數極低。

對教育工作者的啟發

對於開發教育輔助工具或無障礙學習平台的設計者,此研究提供了重要啟發:在設計 AI 導師或輔助工具時,不應僅追求「幫學生做完作業」,更應著重於「解釋解題邏輯」與「引導學生掌控過程」。在數位學習環境中,AI 代理人應被設計為能與學習者進行透明溝通的協作者,透過提供具備上下文關聯的解釋,幫助學習者(特別是特殊需求學生)建立對數位環境的心理模型,而非僅僅提供一個黑箱式的自動化結果。

原始文獻資訊

英文標題:
Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents
作者:
Santosh Patapati
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。