OneDayAgent:邁向自主代理人的長程任務管理框架

arXiv - Human-Computer InteractionJingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

提出 OneDayAgent 框架,透過任務分解、記憶維護與驗證修復機制,解決自主代理人在長程任務中的目標漂移與上下文溢出問題。

AI 幫你先抓重點

AI 重點 1

從「單一模型能力」轉向「系統性框架設計」的思維轉變

滑鼠懸停看 AI 判斷理由
過去研究多聚焦於提升單一 LLM 的推理能力,但本文指出,面對長程任務時,建立一套能管理目標、記憶與錯誤修復的「框架(Harness)」比單純追求模型規模更為關鍵。
AI 重點 2

跨模型後端的通用性與適應性

滑鼠懸停看 AI 判斷理由
這項發現證明了良好的架構設計可以屏蔽底層模型差異,這對於開發者在不同成本與效能需求下切換 AI 模型時,能維持一致的任務執行品質。

核心研究發現

  1. 1

    OneDayAgent 能將開放式請求轉化為受控執行過程,透過將任務分解為有界子任務來應對長程複雜需求。

  2. 2

    該框架具備在上下文壓力下維護執行記憶的能力,並能對最終交付成果進行驗證與自動修復。

  3. 3

    在 AgentIF-OneDay 測試集上,搭配 GLM-5.2 後端時,OneDayAgent 取得了 0.821 的最高評分(SOTA)。

  4. 4

    該框架展現高度泛化能力,無需微調即可在來自三個不同模型家族的五種後端 LLM 上穩定運行。

對教育工作者的啟發

對於開發教育輔助 AI 的設計者而言,這提供了重要啟發:當設計旨在引導學生進行長期專題學習(PBL)的 AI 助手時,不應僅依賴模型本身的對話能力,而應建構一套「管理機制」。這套機制應包含:1. 將複雜學習目標拆解為階段性小目標;2. 在長對話中精準提取與保留關鍵學習脈絡(記憶管理);3. 具備對學生產出進行初步檢核與引導修復的功能。這能有效防止 AI 在長時程教學過程中出現「目標漂移」或遺忘學生先前設定的學習約束。

原始文獻資訊

英文標題:
OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
作者:
Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。