2026
3 篇文章NeMo Automodel 接上 Diffusers:微調影像與影片模型不必先改格式
六個 recipe 涵蓋 FLUX 與 Wan:1.3B 單張 40GB A100 起跳、最大 32B;平行化改 YAML、checkpoint 免轉換回 Hub。
閱讀文章 ↗Stable Audio 3.0 發表:開放權重、6 分 20 秒完整作曲
2026 年 5 月 20 日 Stability AI 發表 Stable Audio 3.0 四模型家族:三款開放權重、最長 6 分 20 秒完整作曲,Small 可在手機端生成 2 分鐘音樂,全家族以完全授權資料訓練,正面挑戰纏訟中的 Suno 與 Udio。
閱讀文章 ↗Sakana AI 發布 Doc-to-LoRA 與 Text-to-LoRA:一次前向傳遞生成 LoRA 配接器
Sakana AI 開源 Doc-to-LoRA 與 Text-to-LoRA 兩個超級網路研究:前者把整份文件壓進不到 50 MB 的 LoRA 配接器,後者用一句任務描述即時產生配接器。本文解析架構、實測數字與限制。
閱讀文章 ↗
2026
2 ARTICLESStable Audio 3.0: Open-Weight Models, Six-Minute Songs
Stability AI ships Stable Audio 3.0 — four models, three open-weight, 6:20 tracks, 2-minute on-device music, all trained on licensed data while Suno and Udio fight in court.
READ POST ↗Sakana AI's Doc-to-LoRA: Documents Become LoRA in One Pass
Sakana AI open-sources Doc-to-LoRA and Text-to-LoRA, hypernetworks that generate LoRA adapters in a single sub-second forward pass — long documents in under 50 MB, task adapters from one sentence.
READ POST ↗