2026 年 2 月 26 日,Perplexity 在研究部落格發布 pplx-embed 家族:pplx-embed-v1 與 pplx-embed-context-v1 兩條產品線,各有 0.6B 與 4B 兩種尺寸,權重放上 Hugging Face。配套論文《Diffusion-Pretrained Dense and Contextual Embeddings》(arXiv 2602.11151,2 月 11 日先行提交)詳述了方法。對做檢索與 RAG 的團隊來說,這是在大型科技商的商用 API 之外,一個可以直接自行部署、又標榜經網頁規模實戰驗證的開放選項。
值得注意的不只是分數。Perplexity 每天處理海量真實查詢,嵌入模型是搜尋管線的核心零件——這批模型先為自家生產環境打造,再開放出來,驗證場景是十億級的生產網頁,而不是只跑學術基準。
兩條產品線、四個開放權重
pplx-embed-v1 是標準檢索模型,針對查詢與獨立文字;pplx-embed-context-v1 則針對 RAG 管線中的文件區塊,把整份文件的全域語境折進每個段落的表徵。兩者各釋出 0.6B 與 4B 版本,Hugging Face 收藏頁另列出一個 pplx-embed-v1-late-0.6b 變體。生態整合已就位:LangChain 與 LiteLLM 可直接呼叫,Perplexity API 的 embeddings 端點也供應同一批模型,自架與託管兩條路都能走。
擴散預訓練與雙向注意力
技術上有兩個關鍵選擇。第一,骨幹採用擴散預訓練的語言模型:模型學習從含噪、破碎的輸入中還原語意,天然對網路上混亂的文字更穩健;且擴散式預訓練自然帶出雙向注意力,每個 token 的表徵都能看到完整序列,因此可用 mean pooling,並支援晚期分塊(late chunking)策略,讓長文件的全域語境在切塊時不被切斷。MarkTechPost 的報導另指出骨幹基於 Qwen3、由因果解碼器改為雙向注意力。第二,多階段對比學習把這個骨幹塑形成檢索模型。兩者相加,構成對「網頁級」這個定語的技術交代。
非對稱檢索與基準表現
pplx-embed 採非對稱設計:查詢端與文件端使用不同的模型,分別處理短查詢與長區塊的不對稱,同時對齊到共享的向量空間。基準成績上,pplx-embed-v1 在 MTEB(Multilingual v2)、MTEB(Code)、MIRACL、BERGEN 與 ToolRet 等測試集上具競爭力;pplx-embed-context-v1 則在專測語境式檢索的 ConTEB 基準上創下新紀錄。更實際的驗證在內部:團隊以來自 10 億個生產網頁打造的評測套件進行測試,並在涉及數千萬文件的真實搜尋情境中驗證。
成本工程:INT8、二值化與 Matryoshka
部署成本被設計成三段可調。模型原生輸出未正規化的 INT8 量化嵌入,官方建議以餘弦相似度比較;再往上可選二值化量化,儲存與記憶體最高節省 32 倍;搭配 Matryoshka Representation Learning,向量可截斷至較少維度,以小幅的效能損失換取更低的成本。對要索引整個網域或數千萬文件的系統而言,這三個開關直接決定帳單數字——檢索系統的成本往往卡在向量儲存與比對,而非生成端。
參考來源
- pplx-embed: State-of-the-Art Embedding Models for Web-Scale Retrieval — Perplexity Research
- Perplexity Releases pplx-embed — MarkTechPost
- Diffusion-Pretrained Dense and Contextual Embeddings — arXiv
本文由 AI 協助自上述來源整理,經人工審核後發布。
