2026
2 篇文章搜尋工具會改變 RL 結果:Exa 的實驗提醒我們別只盯著模型
Exa 用兩個只有搜尋後端不同的 RL agent 做對照:Exa 訓練的 4B 在六個 benchmark 全數領先 SERP 版,還常超過未訓練的 235B,並以 0.58B tokens 追平 1.89B 的表現。本文拆解更密 reward signal 的機制、47 萬次搜尋呼叫的穩定性數據,以及這份廠商研究的限制。
閱讀文章 ↗Perplexity 開源 pplx-embed:擴散預訓練打造網頁級檢索嵌入模型
Perplexity 於 2 月 26 日發布 pplx-embed-v1 與 pplx-embed-context-v1,各提供 0.6B 與 4B 開放權重,以擴散預訓練與雙向注意力主打網頁級檢索。本文解析架構、基準成績與成本工程。
閱讀文章 ↗