NVIDIA

NVIDIA AVO 於 ARC-AGI-3 滿分:模型之外的代理系統才是關鍵

NVIDIA 的 AVO 代理系統在互動推理基準 ARC-AGI-3 公開集拿到 100.00 RHAE、用 6,624 步解完 183 關,本文解析其監督者與持續記憶體設計,以及「模型不是整個代理」的意義。

NVIDIA AVO 於 ARC-AGI-3 滿分:模型之外的代理系統才是關鍵 — 文章封面

NVIDIA 在 2026 年 8 月 21 日的開發者部落格文章公布了一個搶眼結果:該公司的 AVO(Agentic Variation Operators)代理系統在互動推理基準 ARC-AGI-3 的公開測試集上拿到 100.00 RHAE,解完全部 25 個環境、183 個關卡,只用了 6,624 個環境動作。作為對照,同一基準上 Claude Opus 5 單模型在高推理設定的成績約 30%(ARC Prize 數字)。要注意的是,AVO 不是 NVIDIA 訓練的新模型,而是套在前沿 LLM 外面、為長時程自主任務設計的代理系統。

ARC-AGI-3 在考什麼

ARC-AGI-3 是 ARC Prize 團隊推出的第一個互動推理基準,設計前提刻意嚴苛:代理面對的是沒有說明書的遊戲環境,不給規則、不給目標,只能靠探索推論玩法,並在有限行動預算內學會通關。官方強調所有環境都「100% 可由人類解開」,分數衡量的是相對於人類首次遊玩基準的效率(RHAE),重點在技能習得效率與長時程規劃,而不是靜態答題。

換句話說,它考的不是模型知道什麼,而是「面對全新環境,能不能自己學會」——這比選擇題式的考卷更接近產品所說的代理。也要留意成績範圍:這次滿分只涵蓋公開測試集,半私有與私有競賽集不在此列;題目公開之後就會被研究透徹,這是所有基準的共同命運。

AVO 的三個關鍵設計

第一是監督者架構:在主代理迴圈之外,另有一位監督者盯著整條搜尋軌跡,偵測到進度停滯就介入——這是對抗自主代理最容易卡死的迴圈問題的機制。第二是持續記憶體:實作、結果與推理過程跨越上下文視窗累積,後面的嘗試不必從零開始。第三是純文字觀察:每個狀態以 64x64 文字網格呈現,不送任何圖片;動作同樣不附規則與目標。

成績之外還有效率:VISTA 系統同樣以 Claude Opus 5 在這 183 關拿滿分,但用了 7,542 步,AVO 的 6,624 步少了約 12%。工程細節也值得一提:團隊在 DGX B200 上跑了為期七天的注意力核心最佳化,探索 500 多個方向,最終核心比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%。

模型不是整個代理

NVIDIA 的總結寫得很直白:「模型很重要,但模型不是整個代理。」同一個 Opus 5 家族模型,單獨上陣約 30%,放進 AVO 之後拿滿分。作者誠實地說,這不是嚴格控制變因的消融實驗,但方向夠清楚:長時程自主能力來自記憶、工具、回饋與恢復機制的系統整合,而不是單一模型的推理分數。

初步測試還有個有趣的細節:GPT-5.6 Sol 在部分遊戲上用時更短,Opus 則動作數更少——「快」和「省」在代理評測裡是兩個不同的軸,把它們壓成一個數字的排行榜會掩蓋真實的取捨。

對評測與開發者的意義

對做 AI 產品的人,這是選型方法的提醒:模型評測不等於代理評測,採購時該比較的是「模型加上 harness」的整體成績,因為同一顆模型在不同系統裡可以差出一個世代。對基準設計者,公開集被解滿意味著下一輪題目得更快更新,私有集與持續換題會變成常態。對整個行業,這次結果則把「模型之上的工程」量化了:從 30 分到 100 分的距離,是活在權重之外的代理系統工程。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵