2026 年 6 月 17 日,新創 Pramaana Labs 宣布完成 2,700 萬美元種子輪,由 Khosla Ventures 領投,Accel、BoldCap、Nexus Venture Partners、Premji Invest 與 Unbound 跟投。該公司做的事情很少見:把數學證明領域的「形式化驗證」技術搬進 LLM 產品,用一層確定性的驗證器檢查模型輸出,專攻出錯會出人命、賠大錢或失去自由的場景。
時間點值得注意。就在前一天(6 月 16 日),另一家做 LLM 可靠性的新創 Probably 才宣布 900 萬美元種子輪。兩天兩輪融資,說明「LLM 輸出必須可驗證」已經從研究口號變成投資主題。
什麼是形式化驗證,為什麼用它約束 LLM
形式化驗證是用數學方法證明一個系統符合規格的技術,原本用在晶片設計與數學定理證明。Pramaana 的核心工具是開源證明語言 LEAN——數學家用它驗證定理證明,Pramaana 則借用同樣的思路來驗證 LLM 的推論結果。
共同創辦人暨執行長 Ranjan Rajagopalan 的說法是:「世界上最難的問題不是無解,而是未被形式化。」他的命題是:凡是「答錯會讓人損失健康、金錢或自由」的領域,都存在明確規則,而規則可以被寫成可驗證的形式。
LLM 加確定性驗證層的架構
Pramaana 的系統架構是雙層的:一層是傳統 LLM,負責自然語言的彈性與理解;另一層是確定性的驗證層,負責檢查 LLM 的每個輸出是否符合規則。LLM 不再是「答案產生器」,而是「提案者」,最終答案由驗證層背書。
針對每個應用場景,Pramaana 都會在領域專家監督下打造專屬的 LEAN 式驗證系統——這是苦工,也是護城河。先例是法國的 CATALA 專案,它把該國大部分稅制與福利制度轉譯成可執行程式碼,證明「把規則世界形式化」在工程上可行。
法律、稅務與藥物發現:高風險領域先行
Pramaana 的前三個目標垂直領域是法律、藥物發現與稅務。團隊陣容也對應這個布局:前美國國稅局(IRS)局長 Danny Werfel 負責稅法方向,來自 IIT Delhi、IIT Madras 與 UC Berkeley 的教授則監督網路安全與藥物發現系統。
稅務是最好的例子。Rajagopalan 說稅法「像數學一樣,有一大堆必須遵守的規則」,而「一旦有了編碼化的版本,其上的推論就開始變成確定性的」。這正是 LLM 最弱的一環——規則繁多、不容出錯的確定性推理——被驗證層直接補上。
同一週的 Probably:LLM 可靠性風潮成形
前一天宣布融資的 Probably 走的是同一條路線的不同版本。這家由 Peter Elias 創辦、Andreessen Horowitz 領投的公司,第一款產品是資料科學工具:LLM 對資料集給出答案,每個結果都附引用與稽核軌跡,背後是一套 Elias 稱為「資料科學動力裝」的 harness——確定性驗證器會拒絕任何與資料集不一致的輸出,模型本身也針對這個驗證器訓練。
兩個細節值得記住。Probably 目前用的是「比前沿模型弱四個等級」的模型,可以在桌機等本地硬體上跑,token 成本大幅下降——印證 Elias 的原則:「harness 工程做得越好,模型就可以越弱。」他甚至直言大實驗室不做這件事,是因為「你修正模型的次數越多,他們賺得越多」。
對開發者的啟示
三個結論。第一,可靠性問題正在從「prompt 技巧」層級上升到「架構」層級:LLM 提案、確定驗證器裁決的雙層設計,會成為高風險應用的標準模式。第二,驗證層讓你能用更小、更便宜的模型達到接近確定系統的正確率,成本結構因此改寫。第三,形式化規則庫(如 CATALA 之於法國稅法)是新的護城河——誰先把一個領域的規則編碼化,誰就擁有那個領域的 AI 入場券。
參考來源
- Pramaana Labs raises $27 million seed round from Khosla Ventures to bring formal verification to AI — TechCrunch
- Probably raises $9M to build a more reliable kind of AI — TechCrunch
本文由 AI 協助自上述來源整理,經人工審核後發布。
