Image Generation

選影像模型,終於不用只看範例圖了

OpenRouter 推出 Visual Image Benchmarks,用七類挑戰性 Prompt 比較 39 個影像模型,補上文字基準之外的空白。產品工作者可以先用它篩選,再拿自己的內容驗證。

選影像模型,終於不用只看範例圖了 — 文章封面

選擇文字模型時,我們有大量 LLM benchmark 可以參考;輪到影像模型,情況卻很不一樣。OpenRouter 在 2026 年 8 月 21 日發布了 Visual Image Benchmarks,目標是讓開發者與產品工作者在挑選影像模型時,不必再只靠官方範例圖或社群評分。該公司目前提供 39 個影像模型,新的基準頁面把每個模型的輸出並排呈現,並可按價格與生成時間排序。

選影像模型為什麼這麼難?

文字模型的評估已經相對成熟,但影像模型缺乏同等深度的基準。OpenRouter 指出,廠商提供的輸出樣本往往是精心挑選的「eye candy」,而用 LLM 當評審的評估方式,還無法捕捉人類一眼就能看出的細節。競技場(arena)分數雖然有參考價值,但本質上反映的是「使用者比較喜歡哪張圖」,而不是「模型能不能做到某件事」。

這正是產品決策的痛點:如果你的功能需要穩定的文字渲染、準確的物件數量,或是一張圖內同時出現多種語言,光看範例圖很容易誤判。

七類挑戰:把能力差異量化

新的基準不是用一兩張美圖定勝負,而是用刻意設計的 Prompt 去考驗模型的能力邊界。OpenRouter 初步將挑戰分為七個類別:

  • 不合理場景:例如酒倒滿到杯緣、收起來的雨傘。訓練資料裡常見的通常是「正常版本」。
  • 計數:三根手指、特定數量的卡片或骰子。
  • 文字:海報上的一段長字串,以及同一畫面內的多種語言。
  • 空間關係:遮擋與鏡面反射。
  • 否定指令:沒有條紋的斑馬、沒有廣告的時代廣場。
  • 編輯:以參考圖做最小改動、移除物件或人物。
  • 一致性:讓同一個產品或四個參照主體跨場景保持一致。

這些 Prompt 設計成一眼就能看出結果好壞。例如,模型是否能真的把酒杯裝滿到杯緣?這類能力在實際產品中往往比「畫得漂亮」更重要。

先篩選,再回到自己的資料驗證

對產品工作者來說,這類基準的價值在於快速建立 shortlist。你可以先看模型在各挑戰類別的表現,再用 OpenRouter 的圖像生成 API 或 Chat 介面跑自己的 Prompt,確認模型在你真正的情境裡是否同樣可靠。OpenRouter 也預告會把這套評估擴展到影片與音訊模型,並持續更新新增的影像模型。

值得留意的是,基準只是起點。它幫你縮小候選範圍,但最終還是要用自己的內容測試,尤其當你的產品涉及品牌文字、特定數量或複雜版面時。把基準當成輔助決策的工具,而非唯一答案,才會選到真正適合的模型。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵