● Feed Monitor · 每天替你盯顶级英文播客

How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu

Machine Learning Street Talk · 2026-09-16

How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu
一句话摘要

Nvidia Cosmos-3 一套模型能读视频、造虚拟场景,还能在本地小设备上跑,支持机器人和自动驾驶大规模仿真。

多模态模型机器人仿真Nvidia
为什么值得看

Cosmos-3 不只是会看图说话的 AI,它能理解视频、音频、动作,还能直接生成虚拟道路和复杂交互场景,帮机器人和自动驾驶做大规模仿真测试。更特别的是,它能在小型设备本地运行,支持快速微调和安全验证,把“看懂世界”和“动手做事”合成一体,解决现实机器人开发的难题。

结构化解读
Nvidia Cosmos-3 能让 AI 既会看又会动,还能自己造场景

Cosmos-3 不只是识别视频内容,还能直接生成虚拟道路和交互场景,帮你大规模测试机器人和自动驾驶。

  • Cosmos-3 支持多种输入:能处理文本、视频、音频和动作,既能回答“视频里有几辆车”,也能判断机器人任务是否完成。
  • 视频生成能力:能“凭空”生成从未拍摄过的道路和场景,支持自动驾驶和机器人在虚拟世界反复试错。
  • 闭环仿真:研究者可以用它同时模拟 100 辆车在不同路口测试,省下真实车队和场地的高昂成本。
一个模型搞定多模态输入,还能在本地小设备上跑

Cosmos-3 把“看”和“做”合成一体,既能理解视频、音频、动作,还能在边缘设备本地运行,适合实际部署。

  • 模型结构:先用视觉编码器把视频转成“能懂的内容”,再和大语言模型连接,最后用扩散生成器生成视频、动作和音频,保证内容前后连贯。
  • 多模态时间对齐:不同信号(视频帧率、音频频率、动作采样)通过时间嵌入方式对齐,让模型能同步处理不同类型的数据。
  • 三种模型尺寸:有 Super(高精度)、Nano(轻量)、H(专为边缘设备设计)三种版本,H 版能在 Jetson Orin、DJI Spark 等小型硬件本地运行,无需依赖云端。
让机器人“看懂-推理-行动”一体化,解决现实开发难题

Cosmos-3 不只会识别,还能推理和规划动作,支持复杂任务的安全验证和快速迭代。

  • 三大任务合一:模型同时学会“前向动力学”(预测动作后会发生什么)、“逆动力学”(看到变化推断动作)、“策略学习”(决定下一步做什么)。
  • 数据迁移优势:虽然机器人动作数据少,但模型能用大量人类视频数据迁移学习,把“人怎么做”转化为“机器人怎么做”。
带走一句话

“我们希望世界模型(Cosmos-3)能让机器人在虚拟世界反复试错,安全又高效地学会复杂任务。”

AI 视角启发
  • 机器人或自动驾驶项目可以先用 Cosmos-3 在虚拟环境里大规模筛选和验证策略,等到只剩少数优选方案时再实机测试,大幅降低成本和风险。
  • 如果你要让机器人适应新场景,只需用 Cosmos-H 在本地设备上快速微调,无需依赖云端或大规模数据中心,适合部署在工厂、家庭等网络不稳定环境。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02