DiG-bench:遊戲中的發現能力基準測試

arXiv - Artificial IntelligenceRuairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan, Zihan Yan, Timothy Muller, Clare Maguire, Ales Kubicek, Fraser Greenlee-Scott, Sukrit Sumant, Tri Dao, J\"urgen Schmidhuber, Michal Valko, Joshua Tenenbaum, Thomas L. Griffiths, Zeb Kurth-Nelson, James C. R. Whittington

研究者推出 DiG-bench 基準測試,透過 70 款具備未知規則的遊戲,評估 AI 在受控環境中進行實驗與發現新知識的能力。

AI 幫你先抓重點

AI 重點 1

從「執行任務」轉向「發現規則」的評估範式轉移

滑鼠懸停看 AI 判斷理由
傳統 AI 基準測試多著重於已知規則下的任務完成度,而此研究強調在目標與規則皆未知的環境中進行探索,這對於開發具備科學發現能力的通用人工智慧至關重要。
AI 重點 2

實驗性環境在評估代理人自主性中的核心地位

滑鼠懸停看 AI 判斷理由
透過受控的遊戲環境模擬科學實驗過程,這能更精準地衡量 AI 是否具備自主學習與歸納新知識的能力,而非僅僅是模式匹配。

核心研究發現

  1. 1

    DiG-bench 包含 70 款獨立遊戲,每款遊戲皆以短字串編碼,並具有必須透過互動與實驗才能發現的獨特轉換規則。

  2. 2

    遊戲設計分為七個難度等級,從現有模型可輕鬆解決的低難度,到挑戰目前最強代理人架構的高難度等級。

  3. 3

    所有 70 款遊戲在設計時,皆確保至少有一名人類能在第一次嘗試時成功解題,以確保任務的可行性。

  4. 4

    目前研究僅公開釋出其中 21 款遊戲作為測試,其餘遊戲則保留用於安全評估。

對教育工作者的啟發

雖然此研究聚焦於 AI 能力評估,但其「在未知規則環境中透過實驗進行發現」的設計邏輯,對 PBL(專題式學習)與科學探究課程設計具有啟發。教育設計者可以參考這種「分層挑戰」的模式,設計出讓學生在缺乏明確指令的情況下,必須透過觀察、假設與實驗來建構知識的學習情境,從而培養學生的自主學習(SRL)與科學探究能力。

原始文獻資訊

英文標題:
DiG-bench: Discovery in Games
作者:
Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan, Zihan Yan, Timothy Muller, Clare Maguire, Ales Kubicek, Fraser Greenlee-Scott, Sukrit Sumant, Tri Dao, J\"urgen Schmidhuber, Michal Valko, Joshua Tenenbaum, Thomas L. Griffiths, Zeb Kurth-Nelson, James C. R. Whittington
來源:
arXiv - Artificial Intelligence
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。