5 月 11 日,由前 OpenAI 技術長 Mira Murati 創辦的 Thinking Machines Lab 發表長文《Interaction Models》,提出「互動模型」(interaction models)路線:把即時互動能力直接訓練進模型本體,而不是靠語音活動偵測之類的外部工程拼裝。首個研究預覽模型 TML-Interaction-Small 是 276B 參數的 MoE、啟動參數 12B,可同時感知並輸出語音、視訊與文字。
這篇文章挑戰的是目前所有即時語音產品的架構共識:全雙工互動不該住在管線裡,該住在權重裡。對做語音代理與即時產品的團隊來說,這是一個明確的方向訊號。
互動為什麼該長在模型裡
現有對話系統是回合制:模型生成時停止感知,即時感靠 VAD、打斷規則、輪替策略等外部機制模擬出來。實驗室的核心論點引用「苦澀教訓」(bitter lesson):這些手工工程不會隨模型智力提升而等比例擴張,唯有把互動本身變成模型能力,才能跟上規模化曲線。互動模型讓模型在感知的同時生成——安靜、重疊、打斷都留在上下文裡,沒有人為的回合邊界。
200 毫秒微回合:架構怎麼運作
核心機制是「時間對齊微回合」(time-aligned micro-turns):模型以 200 毫秒為單位,交錯處理輸入與生成輸出,對話的節奏資訊因此完整保留。架構採 encoder-free 早融合:語音用 dMel tokens 經輕量嵌入層進入模型、影像切成 40x40 patches 由 hMLP 編碼、flow head 負責解碼語音,全部從零共同訓練。工程面也不含糊:串流推導基於 SGLang(已上游回饋)、批次不變核心保證訓練與取樣位元級一致,另自寫 NVLS 通訊核心與 gather+gemv MoE 核心。
兩個模型:即時在場、後台思考
系統層是雙模型設計:互動模型即時在場,把推理、工具呼叫、瀏覽與長程 agentic 任務交給非同步的背景模型,兩者共享上下文,結果在合適時機串流回對話。數據上這套分工有效:BigBench Audio 從 75.7 拉到 96.5(搭配背景代理)、FD-bench v3 拿到 82.8/68.0 的最佳成績——等於用非思考模型的延遲,拿到推理模型的智力。
基準數字:領先多少、輸在哪
FD-bench v1.5 互動品質 77.8,對手是 GPT-realtime-2.0(minimal)46.8、GPT-realtime-1.5 48.3、Gemini-3.1-flash-live(minimal)54.3、Qwen 3.5 OMNI 39.0;回合接管延遲 0.40 秒全場最佳,對手落在 0.57 至 2.14 秒。但差距不是全面的:Audio MultiChallenge 43.4 只在「即時」模型中最佳,GPT-realtime-2.0 xhigh 的 48.5 仍更高;IFEval 文字 89.7 也輸給 GPT xhigh 的 95.2;HarmBench 拒答率 99.0 則是強項。實驗室另發表一批對手接近零分的新基準:TimeSpeak 64.7 對 4.3、CueSpeak 81.7 對 2.9、RepCount-A 35.4 對 1.3、Charades mIoU 32.4 對 0。
反應、限制與時程
Hacker News 討論拿到 334 點。最受歡迎的示範是「耐心」:使用者中途停下喝咖啡,模型安靜等待。評論者 vessenes 點出模型體積僅 Opus 4.7 與 GPT-5.x 系列的約十分之一,仍有放大空間;swyx 提醒公開的架構只是冰山一角,資料配方與 RL 基礎設施才是真正門檻;也有批評認為示範場景牽強、延遲仍偏高。實驗室自己列出的限制:長時段上下文管理、連線依賴、即時安全對齊、模型放大與雙模型協作。研究預覽未來數月開放,更大模型今年稍後推出,另將啟動互動基準的研究補助。
對開發者的意義
三個實際影響。第一,語音產品的評估要換尺:回合制 ASR-TTS 管線的指標量不到微回合行為,FD-bench 這類測法會逐漸變成標準。第二,中間件價值被壓縮:打斷偵測、輪替策略這層 scaffolding,未來可能被模型原廠直接吸收。第三,2026 年的模型競賽不再只有智力一條軸——即時性正式成為獨立競爭維度,這也印證了年初對模型競賽持續加速的判斷。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
