← 所有主題

Performance

此主題的繁體中文文章,最新優先。

14 篇文章
繁體中文

2026

13 篇文章

  1. OpenAI

    把資料庫呼叫藏起來之後:OpenAI 的 Habitat 如何撐住每秒 7,000 萬次請求

    OpenAI 揭露 Habitat 從 Python 函式庫長成獨立服務的取捨:用技術債換開發速度,代價是尾延遲。

    閱讀文章 ↗

  2. AI Infrastructure

    Megakernel 不是炫技:把 decode 從「等 kernel」改成「等資料」的實作取捨

    Cohere 用單一 CUDA 檔把 North Mini Code 的 decode 做成 persistent megakernel,batch size 1 吞吐從 vLLM 的 185 tok/s 拉到 292 tok/s。

    閱讀文章 ↗

  3. Open Source

    Haiku R1/beta6 出爐:25 週年後的回歸之作

    距離 beta5 約兩年,Haiku 於 25 週年後一週發布 R1/beta6:解決逾 530 張票券,Firefox 正式品牌進駐、QEMU 獲 NVMM 硬體虛擬化支援,git status 熱快取案例從 15 秒降到 2.5 秒。

    閱讀文章 ↗

  4. AI Infrastructure

    Hot Chips 2026:三星把 AI 運算塞進記憶體

    Hot Chips 2026 記憶體議程焦點:三星發表全球首款 LPDDR 型 PIM 解決方案 LPDDR5X-PIM,16 個 bank 內嵌 MAC 單元,內部頻寬 614 GB/s 為外部存取的八倍,但軟體隔離與不可快取存取仍是採用門檻。

    閱讀文章 ↗

  5. Qwen

    Qwen3.8-Flash-Next 發表:新架構把啟用參數壓到 6B

    2026 年 8 月 26 日,Qwen 開源 Qwen3.8-Flash-Next:125B 主模型加 51B n-gram 嵌入表,每個 token 只啟用 6B 參數,原生 262K 上下文,官方定位是極致成本效率。

    閱讀文章 ↗

  6. Developer Tools

    DuckDB v2.0 預覽:新解析器、新儲存格式與伺服器模式

    DuckDB 團隊於 8 月 17 日預覽今秋的 v2.0「Cyanoptera」:原生伺服器模式、PEG 新解析器、儲存格式 2.0、非同步 I/O、觸發器,遞迴查詢快了約 40 倍。

    閱讀文章 ↗

  7. Voice AI

    Nari Labs 把 Qwen3-TTS 壓進 50 毫秒內開口

    Nari Labs 於 8 月 19 日公開 Qwen3-TTS 1.7B 優化成果:單張 H100 上達到每秒 10 次請求、p95 首音延遲低於 50 毫秒,並開源整套服務實作與基準測試。

    閱讀文章 ↗

  8. Developer Tools

    Go 1.27 登場:泛型方法、json v2 與後量子加密

    Go 1.27 於 8 月 19 日發布:方法終於能宣告型別參數,encoding/json 底層改由 v2 實作驅動,ML-DSA 後量子簽章進入 TLS,小物件配置成本最多降 30%。

    閱讀文章 ↗

  9. Developer Tools

    Mojo 1.0 正式登場:給 AI 時代的穩定系統語言

    Modular 於 2026 年 8 月 11 日宣布 Mojo 語言正式抵達 1.0:以穩定為承諾的 1.x 系列,讓開發者能長期建置;標準庫開源以來已有近 200 位貢獻者與超過 1,100 個 PR。

    閱讀文章 ↗

  10. Open Source

    FFmpeg 9.0「Lei」發布:swscale 重寫與更安全的預設

    2026 年 8 月 4 日,FFmpeg 9.0「Lei」亮相:七個函式庫同步升版打破 ABI、swscale 多年重寫落地、動畫 WebP 解碼補上、TLS 憑證驗證預設開啟,開發主場遷往自家 Forgejo。

    閱讀文章 ↗

  11. Local AI

    在 8GB Mac 上跑 26B 模型:TurboFieldfare 的 SSD 串流推理

    開源專案 TurboFieldfare 以 Swift 與 Metal 打造推理引擎:只常駐約 2GB 記憶體,把 Gemma 4 26B-A4B 的 MoE 專家權重從 SSD 逐 token 串流載入,在 8GB MacBook Air 上跑出每秒 5 到 6 個 token。

    閱讀文章 ↗

  12. LLM

    DeepSeek V4-Flash 0731:只重做後訓練,代理能力越級跳

    2026 年 7 月 31 日,DeepSeek 推出 V4-Flash-0731:架構與規模不變、僅重新後訓練,代理基準大幅超越 V4-Pro-Preview,輸出速度每秒 210 個 token,權重續以 MIT 授權開放。

    閱讀文章 ↗

  13. Developer Tools

    Firefox 153 推出:Vulkan 影片解碼與 JPEG XL 終於上船

    Firefox 153 開始向 Release 頻道推出,帶來 Vulkan 硬體影片解碼、Firefox Labs 實驗性 JPEG XL 支援與 Windows HDR 播放,並把本機網路存取改為預設需詢問。

    閱讀文章 ↗

2025

1 篇文章

  1. GPU

    AMD 發表 MI350 系列:4 倍算力、35 倍推論

    2025 年 6 月 12 日,AMD 在 Advancing AI 活動發表 Instinct MI350 系列:288GB HBM3E、原生 FP4/FP6,宣稱對 MI300X 算力最高 4 倍、推論最高 35 倍;MI350X 與 MI355X 已量產出貨,並預告 2026 年 Helios 機架與 MI400。

    閱讀文章 ↗