Ai2

Ai2 拆解混合模型優勢:贏在內容詞,輸在複製

Ai2 用資料與訓練配方完全對齊的 Olmo 3 與 Olmo Hybrid 逐 token 比較損失,發現混合架構在內容詞上明顯佔優,但在逐字複製與右括號上優勢消失,顯示循環層擅長語意狀態追蹤、注意力擅長複製。

Ai2 拆解混合模型優勢:贏在內容詞,輸在複製 — 文章封面

2026 年 6 月 25 日,Ai2 發表文章《Which tokens does a hybrid model predict better?》,搭配 6 月 18 日上傳 arXiv 的技術報告《Comparing Transformers and Hybrid Models at the Token Level》(作者 Yanhong Li 與 William Merrill),用一個少見的做法回答熱門問題:混合架構語言模型,到底贏在哪裡?

把混合模型與純 Transformer 的平均損失拿來相比,只會得到一個籠統的數字。這項研究改為逐 token 比較:兩個模型讀同一段文字,對「下一個正確 token」各給多少機率?研究團隊計算每個 token 上的損失差距,正值代表混合模型預測較好,負值代表純 Transformer 較好,再依 token 類型分組觀察型態。

研究設計:只差架構的對照實驗

研究使用 Olmo 3(7B 純 Transformer)與 Olmo Hybrid。兩者刻意共用訓練資料、詞表與訓練配方,因此預測差異可以乾淨地歸因於架構本身。團隊另外準備三個 1B 模型:純 Transformer、混合模型,以及完全沒有注意力機制的純循環模型,用來切割兩種元件各自的貢獻。

語料涵蓋散文與結構化文字:前者包括新聞、維基百科、書籍與論文,後者包括 Python、HTML 與 LaTeX。token 先依詞性與結構分組計算平均差距,再以迴歸分析控制詞頻、重複出現等干擾因素,確認型態不是統計假象。

混合模型贏在內容詞

結果顯示混合模型在大多數 token 類型上損失較低,優勢最大的是內容詞:名詞、動詞與形容詞的損失差距約 0.04,功能詞只有約 0.02。副詞、形容詞與存在句的 there 差距尤其顯著,顯示混合架構的強項與語意理解高度相關。

論文的合成探針實驗進一步發現,混合模型在代名詞記憶與實體追蹤任務上佔優。作者的詮釋是:循環層擅長維持貫穿全文的語意狀態,因此對需要理解上下文語意的 token 幫助最大;這類 token 往往正是決定句子意思的關鍵。

贏不了的地方:逐字複製與右括號

混合模型的優勢在兩種 token 上幾乎消失。第一是逐字複製:從前文原樣重複出現的 n-gram,重複跨度越長,差距越接近零。第二是右括號:混合模型在左括號上仍佔優,但在右括號上優勢不見,而且這個型態在自然語言、程式碼與標記語言中一致——注意力本身就足夠完成括號配對。

1B 實驗把結論切得更乾淨。在不重複、有語意的 token 上,混合模型與純循環模型都擊敗純 Transformer,混合模型最佳;但在重複出現的 token 上,純循環模型反而落後兩者。這組對照指向同一個結論:複製能力主要來自注意力機制,而語意狀態追蹤是循環層的主場。

為什麼這對模型開發有價值

平均損失像望遠鏡:看得到總分,看不到結構。這篇研究提供的是顯微鏡——分類後的 token 損失在預訓練早期就能計算,不必等整輪訓練結束。對需要決定注意力層與循環層比例的團隊來說,這套方法把「混合架構比較強」從口號變成可量測、可追蹤的訊號。

對開放模型社群還有一層意義:實驗完全建立在 Ai2 開放的 Olmo 權重與訓練配方上,任何人都可以重現與延伸這套分析。對照實驗能成立的前提,正是資料與配方可以完全對齊——這在閉源模型上根本做不到。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵