一個 prompt 變成多模型辯論
OpenRouter 在 2026 年 9 月 10 日推出 Fusion,一個複合推論系統。它把單一 prompt 送給多個模型平行回答,再由一個裁判比較這些回應,最後讓呼叫模型寫出最終答案。這不是簡單的投票,而是結構化的比較:裁判會標出共識、矛盾、部分涵蓋、獨特見解與盲點。
對產品開發者來說,Fusion 的價值在於把原本需要自己寫的協調邏輯,變成一個 model slug 或 server tool。你可以用 openrouter/fusion 直接呼叫,不用自己維護面板、裁判與合成迴圈。
品質提升從哪裡來
Fusion 的品質增益來自兩個來源:模型多樣性與同模型多次執行的變異。OpenRouter 的測試顯示,即使把 Claude Opus 4.8 跟自己配對,融合後的 DRACO 分數也從 58.8% 提升到 65.5%,增加 6.7 個百分點。這代表比較與合成過程本身就有價值,不一定要換不同模型。
但要注意,DRACO 是 Perplexity AI 的深度研究基準,不是通用 coding 或聊天。Fusion 的合成在需要多方觀點的研究與分析任務上最有效,不要假設同樣的增益會出現在所有任務。
成本與延遲的實際代價
Fusion 的預設三模型面板,成本大約是單一模型呼叫的 4 到 5 倍,延遲通常是 2 到 3 倍。面板平行執行,所以不是每個模型依序等,但你還是要等最慢的 panelist 加上裁判。這讓 Fusion 不適合聊天、自動完成等即時路徑。
成本不該只看單次呼叫。如果一次 Fusion 呼叫就得到正確答案,而便宜模型需要三次嘗試、重跑加上人工檢查,那 Fusion 在整個任務的總成本上可能更划算。重點是計算「達到結果的總成本」,而不是單一請求的價格。
什麼時候該用,什麼時候該跳過
最強的生產模式是選擇性升級:讓模型直接處理日常工作,只對少數需要額外審查的 prompt 呼叫 Fusion。這跟 把測試證據放進開發流程 裡談到的「把驗證放在關鍵節點」是同樣的思維。
適合使用的情境:高風險研究問題、專家評論、比較與盡職調查摘要,以及你原本就會手動問多個模型再自己比較的工作。不適合的情境:延遲敏感的互動路徑、需要可重現結果的評估或迴歸測試,以及單一中階模型已經能正確處理的簡單任務。
Fusion 的輸出是非確定性的,這是設計使然。對一次性研究任務沒問題,但對 CI 管線或任何需要比較今天與昨天結果的檢查,就會造成困擾。
實際接入方式
最簡單的 API 路徑是把 model slug 換成 openrouter/fusion。不加額外設定時,它會使用預設的 Quality 面板,並讓模型自己決定是否需要辯論。你也可以用 tool_choice: "required" 強制觸發 Fusion。
import os
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openrouter/fusion",
messages=[{
"role": "user",
"content": "Compare three approaches to multi-tenant data isolation.",
}],
tool_choice="required",
extra_body={
"plugins": [{
"id": "fusion",
"preset": "general-budget",
"model": "~openai/gpt-latest",
}]
},
)
print(response.choices[0].message.content)
目前有三個通用 preset:general-high 最強、general-budget 用較便宜的 panelist 配 frontier 裁判、general-fast 優化相近的回應時間。你也可以把 openrouter:fusion server tool 掛到你自己的 outer model 上,讓同一個模型同時使用 Fusion 和應用程式的其他工具。
從一個困難 prompt 開始驗證
Fusion 給困難 prompt 多次嘗試,並提供結構化的比較方式。但額外的審查有可量化的代價:更多 token、成本、延遲與輸出變異。這些代價只有在減少重試、手動比較或降低根據不完整答案行動的風險時才合理。
實際做法是拿一個你已知困難的真實 prompt,比較 Fusion 與目前生產模型的結果,用「每個被接受的結果的成本」來衡量,而不是只看模型單價。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
