利用 AI 查詢多模態科學論文:盲人、低視能與視力正常科學家的實踐與偏好研究

arXiv - Human-Computer InteractionArnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang, Jonathan Bragg

本研究探討不同視力能力的科學家如何利用 AI 工具進行科學論文中視覺內容的問答互動與探索。

AI 幫你先抓重點

AI 重點 1

AI 錯誤與描述不全會造成跨能力的信任崩潰

滑鼠懸停看 AI 判斷理由
這顯示了 AI 在科學教育與研究工具中的可靠性門檻極高。對於視障研究者而言,錯誤的資訊不僅是錯誤,更是阻礙其獲取知識的障礙,這提醒開發者必須優先解決多模態模型的準確性問題。
AI 重點 2

多模態 AI 具備打破科學資訊獲取障礙的潛力

滑鼠懸停看 AI 判斷理由
傳統的靜態文字描述無法完全傳達圖表精髓,而互動式問答提供了一種新的範式,讓科學家能主動探索視覺資訊,這對於推動科學研究的無障礙化具有深遠意義。

核心研究發現

  1. 1

    研究揭示了盲人與低視能科學家在面對科學圖表時,目前主要依賴靜態替代文字,並透過各種權宜之計來補足視覺資訊的不足。

  2. 2

    科學家在使用 ChatGPT 與 Gemini 進行多模態查詢時,若遇到模糊、不完整的圖像描述或錯誤的 AI 輸出,無論視力狀況如何,都會導致其放棄使用 AI 工作流。

  3. 3

    研究貢獻了一個包含 115 筆查詢與回應的數據集,記錄了不同領域科學家與 AI 工具在處理科學論文時的實際互動過程。

對教育工作者的啟發

對於開發科學學習工具或教育科技的設計者,應注意以下建議:首先,在設計 AI 輔助學習系統時,必須將「多模態準確性」視為核心指標,因為錯誤的視覺描述會直接導致學習者放棄該工具;其次,應開發更具互動性的視覺描述功能,而不僅僅是靜態文字,以支持不同能力的學習者進行深層次的知識建構;最後,在設計科學教學資源時,應考慮到 AI 輔助查詢的侷限性,提供多重感官的資訊路徑,確保科學知識的傳遞具備包容性與公平性。

原始文獻資訊

英文標題:
Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists
作者:
Arnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang, Jonathan Bragg
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。