2026 年 1 月 18 日,TechXplore 報導了一項發表於 Nature Communications 的研究:來自之江實驗室與復旦大學的團隊提出名為 EaPU(error-aware probabilistic update,誤差感知機率更新)的訓練方法,讓憶阻器(memristor)類神經網路的訓練能耗比 GPU 低近六個數量級——接近百萬倍——同時把寫入次數砍掉 99% 以上,裝置壽命延長約一千倍。
對被算力電力成本壓得喘不過氣的 AI 產業來說,這是少見「從硬體底層動手」的路線:不改模型、不改訓練目標,而是重新定義「權重更新」這個最頻繁的硬體操作該怎麼執行。
EaPU:把硬體雜訊寫進演算法
問題的根源在於一種根本的不匹配。反向傳播假設權重更新是確定性的、可以小幅精密微調;但憶阻器的實際行為是隨機的——同一個電壓脈衝,每次造成的電導變化都不同,而且裝置鬆弛(device relaxation)會讓寫入誤差隨時間累積。硬體雜訊直接污染梯度,訓練結果自然崩壞。
EaPU 的解法是與雜訊共存而非對抗。當某一步期望的權重變化低於門檻值時,演算法不做小幅寫入,而是改為:以與期望變化量成比例的機率,施加一次「全額門檻脈衝」,否則完全跳過這次寫入。以期望值來看,更新的平均量維持不變,訓練性能得以保留;但實際寫入次數大幅下降——每步需要更新的參數不到 0.1%,在 152 層的 ResNet 上相當於每千個參數只有 0.86 次寫入。
百萬倍能耗差距從何而來
數字分三層看。相較於先前的憶阻器訓練方法,EaPU 的訓練能耗低約 50 倍;相較於當時最先進的 MADEM 方法,低約 13 倍;而相較於 GPU 訓練,差距接近六個數量級。研究團隊指出,多項研究已證實憶阻器記憶體內運算具備顯著能源效率,而寫入誤差隨時間累積、受裝置鬆弛影響,正是過去難以發揮的主因。
寫入次數銳減帶來的另一個紅利是壽命:憶阻器的耐用度由寫入循環決定,更新次數少了兩個數量級以上,裝置壽命相應延長約一千倍。這對部署成本的意思很直接——同樣一批硬體可以訓練更多輪、用更久。
從影像去噪到 152 層 ResNet 的驗證
驗證分兩軌。模擬方面,團隊測試了最深 152 層的 ResNet 與 Vision Transformer,在含雜訊硬體上,EaPU 相比標準反向傳播帶來超過 60% 的準確度改善。實體硬體方面,團隊自製了一套 180 奈米製程的憶阻器陣列,跑影像去噪與超解析度任務,結構相似度(SSIM)分別達到 0.896 與 0.933,與常規訓練持平甚至更好。
這組數字的意義在於:機率式更新沒有用準確度換能耗。EaPU 透過機率轉換改變更新的幅度分布,「更新的平均值維持不變,以保證訓練性能」——這是整個方法能站住腳的關鍵設計。
距離 LLM 訓練還有多遠
必須誠實面對落地距離。目前的實體驗證是在 180 奈米的小型陣列上完成,任務是影像還原而非語言建模;模擬固然涵蓋了深層 CNN 與 ViT,但 LLM 規模的憶阻器訓練仍屬願景。團隊自己也把下一步指向兩個方向:把 EaPU 擴展到鐵電電晶體與磁阻式記憶體等其他記憶體技術,以及探索用於 LLM 的訓練叢集。程式碼已在 Zenodo 上公開發布。
對基礎設施決策者而言,這類研究短期內不會改變採購單,但它指出了一條與「堆更多 GPU」完全不同的 scaling 路徑:當訓練的能耗瓶頸來自資料搬移與寫入,而不是計算本身,演算法與硬體的協同設計就是真正的槓桿。值得把 EaPU 放進觀察清單,等它在更大模型上復現。
參考來源
- New memristor training method slashes AI energy use by six orders of magnitude — TechXplore
- Error-aware probabilistic training for memristive neural networks — Nature Communications
本文由 AI 協助自上述來源整理,經人工審核後發布。
