當 OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 基準測試上只拿到 7.8% 分數時,團隊的第一個念頭是:2D 拼圖遊戲對模型來說太難了嗎?但深入調查後,他們發現問題不在模型本身,而在測試框架的兩個 API 設定。
ARC-AGI-3 是一個要求 AI 代理在陌生 2D 遊戲中學習與推理的基準測試。OpenAI 在官方部落格文章中說明,當他們啟用「保留推理」(retained reasoning)與「壓縮」(compaction)這兩個設定後,GPT-5.6 Sol 的分數從 13.3% 躍升到 38.3%,輸出 token 減少了 6 倍。這不是模型能力的改變,而是測試環境的調整。
問題出在測試框架,而不是模型
ARC-AGI-3 的官方測試框架刻意保持簡單,不使用工具或特殊功能,目的是讓模型的缺點更明顯,也讓不同模型的比較更公平。但 OpenAI 發現,這個框架有兩個設計會阻礙模型表現:
- 丟棄推理:每次動作後,模型的所有私人推理都被丟棄,導致它無法記住自己過去的思考過程,只能看到動作記錄和簡短註記。
- 滾動截斷:當對話超過 175,000 字元時,最舊的訊息會被刪除,讓模型逐漸失去對早期動作的記憶。
這兩個設計讓 GPT-5.6 Sol 無法在遊戲中累積學習,每次動作都像重新開始。OpenAI 指出,這解釋了為什麼模型在官方框架下表現不佳。
保留推理與壓縮的實際效果
OpenAI 的模型在訓練時會保留私人推理訊息,並在對話過長時進行摘要壓縮,這是他們在 ChatGPT 和 Codex 產品中的標準做法。當他們用 Responses API 重現這個設定後,觀察到兩個明顯變化:
- 思考時間減少:模型不再需要每次從零開始理解遊戲,因為它能記住過去的想法。
- 策略更連貫:模型能更好地學習遊戲規則,並採用一致的策略。
壓縮取代滾動截斷後,模型能保留更早的觀察和行動,在長時間任務中表現更好。OpenAI 強調,這兩個設定合併使用,讓 GPT-5.6 Sol 以 6 倍少的輸出 token 達到 3 倍的分數。
對開發者與評估者的啟示
OpenAI 在結論中提醒,基準測試很少單獨衡量模型,它們同時衡量 API 設定、測試框架設計和提示詞等隱藏選擇。他們建議 API 開發者採用與自家產品相同的設定:使用 Responses API、保留推理、啟用壓縮。
對於比較模型的人,OpenAI 建議依賴使用這些設定的評估,因為這更貼近 ChatGPT 和 Codex 的實際使用情境。這不是 OpenAI 第一次發現低分源於測試框架的通用設計,而是再次提醒我們:評估結果需要謹慎解讀。
這個案例對產品開發者很有價值:當模型在特定基準上表現不佳時,先檢查測試環境是否與實際部署一致。調整設定可能比調整模型更有效,也更能反映真實世界的效能。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
