做翻譯功能時,最怕的不是模型分數不夠高,而是上線後才發現長文件品質崩潰、吞吐量撐不住併發。Cohere 在 2026 年 9 月 10 日發布的 North Small Translate,直接把這兩個痛點攤在規格表上:218B 總參數、25B 活躍參數的 MoE 架構,16k 輸入與 16k 輸出的 context length,最低硬體需求是 1 張 B200 或 2 張 H100(W4A4 量化)。
分數之外:長文件與吞吐量才是部署關鍵
WMT26 全語言平均 83.6 分,贏過 DeepL NextGen 的 81.37、Gemma 4 31B 的 79.46,以及 Google Translate 的 68.20。但對產品開發者來說,更有參考價值的是長文件評測:North Small Translate 拿到 48.9 分,是 Google Translate(21.3)與 Gemma 4 31B(19.4)的兩倍以上。這代表翻譯兩個章節的書本內容時,不會出現品質斷崖。
吞吐量同樣是硬指標。在相同硬體與併發條件下,North Small Translate 的輸出速度比 Gemma 4 31B 快 30–38%:低併發時 112 TOPS 對 81 TOPS,高併發時 39 TOPS 對 30 TOPS。如果你正在評估翻譯 API 或自建模型,這兩個數字比平均分數更能預測實際使用體驗。
成本結構:每任務 0.000676 美元背後的取捨
Cohere 公布的商業授權成本是每任務 0.000676 美元,平均只用 661 個 token,對比 Gemini 3.1 Pro Preview 的 0.038928 美元,差距超過 57 倍。但要注意,這是企業商業授權的價格,不是 Hugging Face 上開放權重的使用成本。開放權重版本採用 CC BY-NC 4.0,僅限研究與非商業用途,想用在產品上得走 RWS 的 Language Weaver 平台。
這裡的取捨很清楚:如果你需要的是可控的翻譯品質與成本,自架 North Small Translate 需要 1–2 張高階 GPU;如果只是要快速驗證,API 或輕量模型可能更實際。就像我們在把測試證據放進開發流程裡討論的,模型分數只是起點,真正決定成敗的是你怎麼把它接進現有流程。
Agentic 版本:把「找錯」變成產品功能
North Small Translate 還有一個 Agentic 版本,能在翻譯後找出並修正錯誤,WMT26 分數提升到 84.36。這對需要高準確度的場景(例如法律文件、醫療說明)特別有意義,但代價是額外的運算與延遲。Cohere 沒有公布 Agentic 版本的吞吐量或成本,所以如果你考慮這個功能,得自己測試延遲是否在可接受範圍內。
下一步:先測長文件,再談整合
North Small Translate 的價值不在於又一個高分模型,而在於它把長文件品質與吞吐量這兩個部署痛點量化了。如果你正在評估翻譯方案,建議先用兩個章節的長文件做一次盲測,同時記錄併發下的 TOPS。分數會騙人,但延遲與品質崩潰不會。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
