CentaurBench:評估 LLM 在自動化與增強現實工作任務中的能力差異

arXiv - Computers and SocietyPattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj

研究發現 LLM 在「自動化任務」表現優異的模型,在「輔助他人工作」時並不一定能提供有效的指導。

AI 幫你先抓重點

AI 重點 1

自動化能力不等於輔助能力

滑鼠懸停看 AI 判斷理由
這挑戰了目前以「模型直接產出結果」作為衡量標準的慣例。在教育或協作場景中,我們更需要的是能引導學習者或協作夥伴的模型,而非僅僅是替換人類工作的工具。
AI 重點 2

重新定義 AI 評估的基準維度

滑鼠懸停看 AI 判斷理由
這提醒開發者與研究者,當 AI 被定位為「助手」而非「執行者」時,必須開發全新的評估框架,否則會誤判 AI 在人機協作系統中的真實價值。

核心研究發現

  1. 1

    研究發現自動化模式與增強模式的排名相關性極低,在七項任務中有五項在自動化表現最佳的模型,在增強模式下反而表現不佳。

  2. 2

    輔助效果並不穩定,在七項任務中有三項任務中,未經輔助的原始模型表現甚至優於接受 AI 指導後的表現。

  3. 3

    在所有測試的模型中,僅有一個模型的指導建議平均而言能優於完全不提供任何指導的情況。

對教育工作者的啟發

對於教育科技設計者而言,這項研究提供了重要的警示:設計「AI 導師」或「學習輔助工具」時,不能僅追求 AI 本身的知識量或解題能力。如果目標是透過 AI 增強學生的學習過程(Scaffolding),開發重點應放在 AI 如何生成高品質的引導、提示與反饋,而非直接給出答案。我們需要建立新的評估指標,專門衡量 AI 提供之「腳手架」對學習者(或低能力代理人)表現的實際提升程度,避免開發出看似強大卻在協作中產生負面干擾的工具。

原始文獻資訊

英文標題:
CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks
作者:
Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。