英伟达在 SIGGRAPH 2026 发布Cosmos 3 Edge,属于 Cosmos3 物理 AI 世界模型家族,4B(40 亿)参数,专门面向边缘设备,实现完整多模态推理、视频预测、机器人动作策略全部本地端侧运行,不依赖云端。
核心模型规格
总参数:40 亿(4B),双塔式 MoT 架构
Reasoner 推理塔:2.4B,负责图像 / 视频 / 文本理解、任务规划
Generator 生成塔:≈1.6B,输出视频画面、机器人动作轨迹
输入模态:文本、图片、视频、动作序列
输出模态:文本、图像、预测视频、机器人动作指令
精度:BF16;开源协议 OpenMDW 1.1;权重开源在 HuggingFace/GitHub
同家族对比
|
模型 |
参数 |
部署场景 |
|
Cosmos3Super |
64B |
云端 / 数据中心 |
|
Cosmos3Nano |
16B |
高性能工作站 |
|
Cosmos3Edge |
4B |
边缘盒子、机器人机载硬件 |
支持硬件(边缘盒子 / Jetson)
1. 最优生产硬件:Jetson Thor(T4000/T5000),可做到5‑15Hz 机器人闭环实时控制,满足工业机器人、人形机器人低延迟要求
2. 向下兼容:Jetson AGX Orin 64GB;Orin NX 16GB 可跑推理部分;Orin Nano 8GB 仅可运行推理模块
3. 开发端:RTX3070 及以上消费显卡、RTX PRO 工作站;显存建议≥16GB
注意:国产边缘算力板卡(RK3588、BM1684X 等)无官方适配,需要做大量移植量化工作,原生仅支持英伟达 CUDA/Jetson 硬件栈。
核心能力
1. 物理世界预测:读取摄像头视频流,预测未来画面变化,理解物体运动、碰撞物理规则
2. 端到端机器人策略:输入自然语言指令 + 摄像头画面,直接输出机械臂动作轨迹,不需要分开做感知‑检测‑规划链路,代表模型Cosmos3‑Edge‑Policy‑DROID
3. 全本地闭环:感知→推理规划→生成动作全部在边缘盒子完成,消除网络往返延迟,适合工厂、无人设备、自动驾驶感知,断网也可工作
4. 支持后训练微调:开发者可 1 天左右微调适配自有机器人、业务场景,提供完整微调脚本
软件部署要点
推理引擎:vLLM‑Omni;Linux+CUDA13 容器;OpenAI 兼容 API 接口调用
典型用途:工业机器人、人形机器人、智能车载感知、智慧现场视频预测、巡检设备端侧 AI
行业意义
过去世界模型大多只能跑云端大 GPU,Cosmos3 Edge 把 4B 级全模态世界模型下放到边缘盒子,机器人不再需要把视频传到云端做决策;但硬件绑定 Jetson 生态,国产边缘芯片要跑该模型面临移植、量化、性能的挑战。
对比:传统边缘 AI 盒子大多跑检测识别模型;Cosmos3 Edge 属于世界模型,不止识别物体,还能预判环境变化、直接输出执行动作,是物理 AI 落地边缘的标志性模型。
需求留言: