2026 年 6 月 12 日,OpenRouter 發布 Fusion:一次 API 呼叫,把同一個 prompt 平行派給一組「面板模型」,每個都帶著網路搜尋與抓取工具跑完整個任務;裁判模型讀完所有回答,標出共識、矛盾、涵蓋缺口與盲點,最後交回發起呼叫的模型作答。整條管線在伺服器端跑完,對呼叫方來說就是一次普通的模型呼叫。
主打的是實測成績:在深度研究基準 DRACO 上,融合面板勝過所有受測的單一模型。
Fusion 怎麼運作
架構分三層。面板層:你選定的多個模型,各自用 openrouter:web_search、openrouter:web_fetch(經由 Exa)與 openrouter:bash 完整執行任務。裁判層:讀取全部面板回答,標出共識、矛盾與涵蓋範圍。合成層:呼叫端模型根據這份分析撰寫最終回答。Fusion 不是把輸出糊在一起,而是把多模型當成獨立的論證來源,把判斷收斂到單一出口。
DRACO 實測:融合面板贏過所有單一模型
DRACO(arXiv 2602.11685,Perplexity AI 提出)包含 100 道深度研究任務、跨 10 個領域、約 39 項加權評分標準,分四類(事實準確、廣度深度、呈現、引用),每項標準評分三次。OpenRouter 用 Gemini 3.1 Pro Preview 當裁判,並以 Claude Sonnet 4.6 做 sanity check。
結果:最佳組合 Claude Fable 5 + GPT-5.5(合成用 Opus 4.8)拿下 69.0%;Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro 的三模型組合 68.3%;單模型最強是 Claude Fable 5 的 65.3%,且是在 100 題只作答 93 題的情況下取得——內容過濾器擋掉 7 題(這個模型隨後的處境,可參考我們先前的追蹤報導)。更實用的是平價組:Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro(合成用 Opus 4.8)拿到 64.7%,成本約 Fable 5 的一半,分數差距不到 1 分,還壓過單打獨鬥的 GPT-5.5(60.0%)、DeepSeek V4 Pro(60.3%)與 Opus 4.8(58.8%);Gemini 3.1 Pro 單獨只有 45.4%。
自融合效應與污染控制
兩個細節值得記下。第一,把 Opus 4.8 自己融合自己(兩個實例、一次合成)得到 65.5%,比單跑的 58.8% 高出 6.7 分——增益有一大塊來自「合成」這個步驟本身,而不只是模型多樣性。第二,測試過程中面板模型竟透過網路搜尋找到了 DRACO 的評分標準原文;OpenRouter 隨即用 excluded_domains(web_search)與 blocked_domains(web_fetch)把 rubric 來源擋掉,所有公布數字都是排除污染後的成績。
四種接法、延遲與限制
整合方式有四種:網頁版 chatroom(openrouter.ai/fusion)、模型代號 “openrouter/fusion”(自動帶預設前沿面板)、server tool(tools 陣列加入 openrouter:fusion,由基底模型決定何時呼叫)、plugin(自訂面板與合成模型)。代價是延遲:觸發 Fusion 的呼叫「通常是標準呼叫的 2 到 3 倍長」,因為要等所有面板完成;定價未公布,只有相對成本比較。限制也說得直白:DRACO 是純文字、僅英文、靜態題庫;換裁判模型絕對分數會浮動 10 到 25 分(排名穩定);長程任務沒測——那正是 Fable 5 的強項;也別拿來取代 coding model,官方建議讓 coding model 在關鍵決策點選擇性呼叫。
參考來源
- Surpassing Frontier Performance with Fusion — OpenRouter
- openrouter/fusion model page — OpenRouter
- Openrouter Fusion API — Hacker News
本文由 AI 協助自上述來源整理,經人工審核後發布。
