6 月 1 日消息,英偉達今日正式推出英偉達 Cosmos 3,這是一款面向物理人工智能的開放世界基礎大模型,依托混合 Transformer 架構打造,在單一系統中融合視覺推理、世界生成與動作預測能力。

英偉達稱,Cosmos 3 是全球首款全開源的全模態大模型,可原生理解并生成文本、圖像、視頻、環境音效及動作內容,物理仿真精度業界領先。它能將物理人工智能的訓練與評估周期從數月縮短至數日。
英偉達同時發起英偉達宇宙聯盟(NVIDIA Cosmos Coalition),匯聚全球世界模型研發團隊與人工智能開發者攜手合作,成員包括 Agile Robots、Black Forest Labs、Generalist、LTX、Runway 以及 Skild AI,共同推動下一代世界模型技術發展。
英偉達創始人兼首席執行官黃仁勛表示:“多模態推理語言、視覺與世界模型接連取得突破,物理人工智能的變革時代即將到來。Cosmos 3 系列開源前沿全模態模型,將助力開發者實現技術跨越,打造能在現實世界中感知、推理、規劃并執行動作的機器人、自動駕駛汽車及視覺人工智能系統?!?/p>
物理人工智能長期面臨一大核心難題:如何讓機器人、自動駕駛車輛與視覺智能體,依托有限訓練數據和零散仿真框架,在真實場景中具備泛化能力。Cosmos 3 就此給出解決方案。
該模型采用混合 Transformer 架構,將推理 Transformer 與專精生成類 Transformer 相結合。模型會先解析物體交互、運動規律以及時空關聯關系,再完成視頻生成與動作軌跡預測。
Cosmos 3 基于海量多模態物理人工智能數據集訓練而成,涵蓋數十億條文本、圖像、視頻、音效及動作軌跡樣本。開發者借助這款預訓練基礎模型,能用更少數據、更低成本搭建物理人工智能系統。
開發者可將 Cosmos 3 用作三類工具:
1. 多模態圖文大模型,實現跨模態理解與推理;
2. 世界模型 / 視頻基礎模型,仿真物理環境、預判場景未來狀態,支撐模型訓練與評估;
3. 世界動作模型主干網絡,輔助訓練機器人完成各類專項任務。
IT之家注意到,在物理人工智能主流評測基準中,Cosmos 3 表現優異。在開源模型范疇內,其世界生成精度在 Artificial Analysis、Physics-IQ、PAI-Bench 和 R-Bench 中排名第一;動作策略能力領跑 RoboLab 和 RoboArena 基準;視覺理解能力位居 VANTAGE-Bench 和 TAR 榜單榜首。
Cosmos 3 提供多個版本,適配物理人工智能不同研發階段需求:
Cosmos 3 Super:面向機器人與自動駕駛模型的二次訓練,追求極致物理精度與生成效果;
Cosmos 3 Nano:數秒內即可完成高品質視頻解析與動作推理;
Cosmos 3 Edge:即將上線,主打邊緣端實時推理。
Cosmos 3 Super 與 Nano 現已正式推出,Edge 版也即將上線,支持邊緣端實時推理。

