NVIDIA 的效率怪獸:一個 30B 開源多模態模型,如何用五招把影音處理做到又快又便宜
NVIDIA 一個 30B 參數的開源多模態模型,主打的不是「最聰明」,而是吞吐量與成本效率——影音處理又快又便宜。它用五個設計把影像、影片、音訊的處理成本壓下來,代價是純文字推理與程式碼能力不是頂尖。
Tag
3 篇文章
NVIDIA 一個 30B 參數的開源多模態模型,主打的不是「最聰明」,而是吞吐量與成本效率——影音處理又快又便宜。它用五個設計把影像、影片、音訊的處理成本壓下來,代價是純文字推理與程式碼能力不是頂尖。
NVIDIA 團隊的 Sonic 用約 4200 萬參數,把人類動作影片、語音、音樂甚至文字,轉譯成人形機器人能穩定執行的全身動作;訓練昂貴但成品輕到能在手機上跑,並開源釋出。
Lyra 2.0 用『逐幀 3D 幾何快取』記住場景骨架,讓從單張照片生成的可探索世界在你回頭看時也不會崩壞;核心生成器是類似 Sora 的 diffusion transformer,而且模型與程式碼免費釋出。