● Feed Monitor · 每天替你盯顶级英文播客

Runway’s Bet Beyond Video: World Models, Robotics, and the Neural OS — Anastasis Germanidis

Latent Space · 2026-09-26

Runway’s Bet Beyond Video: World Models, Robotics, and the Neural OS — Anastasis Germanidis
一句话摘要

Runway 联创 Anastasis 复盘:2024 年 2 月 Sora 发布后公司经历"存在危机",团队用 3 个月把模型规模和算力拉大 10 倍,当年夏天推出 Gen 3 反超。

视频生成世界模型Runway创业
结构化解读

视频模型的终局不是电影,而是神经操作系统

Anastasis Germanidis 是 Runway 联合创始人。Runway 从 2018 年起步,最早做的是把难用的机器学习模型交给创作者;其 Green Screen 抠像工具后来进入了《Everything Everywhere All at Once》。但 Germanidis 这次谈的已不是“AI 怎么帮你拍片”,而是另一条更长的线:视频模型一旦学会预测世界接下来会发生什么,就可能成为软件界面、机器人模拟器,乃至科学计算的共同底座。Runway 正试着把这条线从生成视频,一路延伸到世界模型与机器人。

这期回答了 7 个问题:

  1. 为什么未来的软件前端可能不再需要 HTML、CSS 和 React?
  2. 只靠扩大视频模型,真的能学会物理规律,而不必先发明新架构吗?
  3. 为什么文生视频的核心瓶颈不是画质,而是控制权和响应速度?
  4. 机器人为什么该先看海量第三人称视频,再学习操控自己的身体?
  5. 创意人员如何从 AI 工具的使用者,变成模型训练团队的一部分?
  6. 世界模型已经能连续生成多久?距离开放世界和 VR 体验还差什么?
  7. 为什么 RGB 视频预训练可能迁移到物理、音频乃至科学模拟?
1. 软件前端将从“写代码”变成“直接生成像素”

被问到 Interface World Model 在未来两三年会走向何处时,Germanidis 把终点说得很激进:它不只是更会做网页的模型,而可能成为“完全神经化的操作系统”。Runway 展示的原型里,界面由实时视频生成模型直接渲染。背后没有 HTML、CSS 或 React;用户点击、拖拽、滚动,模型接收这些动作,再预测屏幕下一刻应该长什么样。甚至按钮按下后的行为,也可以用提示词描述,而非先让工程师把逻辑写进组件。

他的逻辑是:传统前端本质上是在写一层代码,让浏览器最后生成像素;既然模型已经能直接预测像素,为何还要绕一圈?"why why generate the code that generates the pixels just generate the pixels directly"(为什么要生成那些用来生成像素的代码?直接生成像素就好了。)

这意味着,软件的“界面”可能不再是一套固定页面,而是随任务临时长出来的交互表面。语言模型知道用户正在做旅行规划,就能把地图、预算、日程和预订功能拼到同一个界面里;面对视力不佳的用户,则可直接生成更大的文字、更清晰的操作路径。原型设计、教学演示、无障碍体验会最先吃到这套能力。

但这不是明天就能替换网页。实时跑视频模型,比浏览器渲染 HTML 贵得多。一个有动态背景、人物走动的界面,模型必须持续生成,账单会很吓人。Runway 的判断是,先找到传统界面明显不够好的场景,再等待模型推理成本下降;不是所有按钮都需要由神经网络来画。

2. 世界模型不必先换架构:扩大视频预测已让物理能力稳定提升

被问到是否必须采用 JEPA 这类新架构,而不能继续做视频预测时,Germanidis 的回答很务实:如果新方法确实更强,Runway 会用;但目前没有证据表明,预测视频这条路已经碰到天花板。团队用 PhysicsIQ 测量模型的“直觉物理”:给图像转视频模型一张首帧,例如一个球悬在天花板下,让它续写接下来会发生什么。球是否会下落、怎么落地,涉及力学;类似题目还覆盖流体动力学和光学。

Runway 在不同模型规模、不同计算规模上测试后,看到一个关键趋势:模型越大,PhysicsIQ 分数越高,而且不是偶然抽中几道题,而是有可预测的上升曲线。"we see those predictably improve as we scale those models."(我们看到,随着模型规模扩大,这些能力会以可预测的方式提升。)

这意味着,短期内世界模型的竞争更像一场工程赛:谁有更多合适数据、更大训练算力、更严格的物理评测,谁就更可能领先。任何声称“必须抛弃视频预测”的新架构,至少要先超过这条持续变强的基线。它把争论从理念拉回了测量:模型到底能否预测球落下,而不是能否讲出一套优美理论。

边界也很清楚。视频模型会“耍镜头语言”:它可以切镜头、避开关键碰撞、用视觉连贯掩盖物理错误。因此,漂亮样片不等于理解重力。Germanidis 也提醒,当前结果很容易被挑选得比真实能力好看;真正的难点是让模型在连续、可交互的因果过程中始终不露馅。

3. 生成质量越高,创作竞争越不在提示词,而在可控性和延迟

被问到 Runway 从早期视频模型产品化中学到了什么时,Germanidis 提到一个反直觉教训:Gen 2 当年带来了明显的质量跃升,却仍主要被拿来探索,而不是进入稳定制作流程。原因不复杂:用户无法带入足够的参考,也不能可靠控制镜头和物体。模型偶尔生成一段惊艳画面,不等于导演能把它放进分镜表里。

Runway 在 2023 年密集补上这些“看似琐碎”的控制层。Motion Brush 允许用户在画面上画箭头,指定物体朝哪边移动;Camera Control 让用户用文字描述镜头如何推、拉、摇、移。后来模型能接收多达 50 个参考,创作者不必只赌一句提示词。Germanidis 对早期用户反馈的概括很直白:"people wanted a lot more control than that."(人们想要的控制远不止这些。)

这意味着,生成式视频不会只比“第一张结果谁更震撼”。更重要的是收敛能力:能否用参考图锁定角色,用镜头指令锁定构图,用动作约束锁定表演,然后一轮轮逼近脑中的结果。它更像摄影棚,而不是抽奖机。提示词仍是入口,但不再是创作的全部。

另一个决定体验的变量是延迟。等两分钟生成一段视频,会切断 Photoshop 式的即时试错:你刚有感觉,节奏已经断了。Runway 因而押注实时蒸馏模型——把原本需要许多生成步骤的模型压缩得更快。但实时版本和未蒸馏的基座模型之间仍有质量差距。质量是底线,控制和速度决定它能否变成日常工具。

4. 机器人缺的不是更多遥操,而是把第三人称视频变成预训练底座

被问到世界模型为何会成为机器人训练和模拟器基础时,Germanidis 把矛头对准了机器人数据的稀缺。让人远程操控机械臂收集数据,昂贵、慢,还受硬件数量限制;即便在人的头上绑 GoPro,采集第一视角视频,存量依然远少于互联网中“人看人做事”的第三人称视频。按他的估计,第一视角数据相比第三人称视频,规模少了三个数量级。

Runway 的 GWM Robotics 从 Gen 4.5 视频扩散骨干出发,再用数百小时量级的机器人数据微调;作为对比,从零预训练机器人模型,常见规模是数十万到数百万小时。其核心判断是:先让模型从海量视频里学会人、物体、动作和环境如何变化,再让它用小量具身数据认识某种机械臂的关节与动作空间。"the most plentiful source of data will ultimately ultimately wins"(最终获胜的,将是数据最充足的来源。)

团队还用 RoboArena 基准验证“真实—模拟相关性”:在相同场景、相同指令、相同具身设定下,比较动作模型在世界模型里和现实世界里的表现,并称两者相关性较好。若这个相关性稳定,机器人策略就能先在模型里大量试错,不必每次都去消耗真实硬件。

这条路还没通向一个万能机器人。目前,Runway 仍需为合作方的单臂、双臂或人形机器人分别后训练。所谓统一世界模型,是未来一两年的预期,不是已经交付的能力。第三人称视频能提供广泛常识,却不能自动解决“这只机械手具体能转多少度”的身体问题。

5. 创意团队不是模型发布后的包装,而是训练管线的一部分

被问到 Runway 是否要招募同时具备艺术能力与研究能力的人时,Germanidis 给出的组织答案很具体:公司有一个深度参与训练的大型创意团队,而且他们不只负责模型发布后的宣传片。创意人员参与设计视频如何标注,要求标注足够细,能写出摄影、美学、镜头方向等信息。因为模型在推理时能否听懂“低机位推进”“颗粒感画面”或某种构图,取决于训练时这些概念是否被可靠地写进数据。

他们还承担另一项更难量化的工作:判断什么输出叫“可用”。不是画面无明显瑕疵就算过关,而是它是否能被放进创作流程,是否给了用户足够的可编辑空间,是否符合镜头语言。Germanidis 说:"our creative team also does a lot of evaluation of like you know what constitutes a usable video out of those models."(我们的创意团队也会大量评估:这些模型生成什么样的视频才算真正可用。)

这意味着,生成媒体公司的关键能力,不只是堆 GPU、训练更大的模型。摄影师、导演、设计师脑中那些原本说不清的判断,要被翻译成三种东西:训练数据里的标注,训练时要优化的目标,以及发布前的评测标准。所谓“品味”,不再只存在于某个艺术总监的直觉里,而要进入模型循环,变成可反复校验的生产要素。

这也改变了创意岗位的位置。创意人员不再只是 AI 工具的末端使用者,而是决定模型到底学什么、何时算够好的参与者。研究员和创意人员并排工作,不是为了让技术显得更有艺术感,而是因为视频模型本身就需要学会视觉表达中的大量隐性规则。

6. 能连贯几分钟不等于能生成开放世界:自回归误差仍会滚雪球

被问到什么突破能解锁下一批世界模型应用时,Germanidis 首先提到长上下文,也就是模型能在更长时间内记住自己此前生成过什么。Runway 的 Characters 模型已经能自回归生成最长约 30 分钟的视频;这里的“自回归”是指模型生成一帧或一段后,再把自己的输出喂回去,继续生成下一段。但用于开放式世界探索的 GWM Worlds,目前只能稳定持续数分钟。

两者差别不只是时长。角色模型面对的场景较受控:人物、镜头、互动模式相对有限。开放世界则允许用户任意移动、转向、拿起物体、改变路线,每次行动都制造新的后果。模型需要同时维持空间布局、物体状态、因果关系和视觉一致性。问题在于,它吃进去的不是完美真实画面,而是自己刚生成的结果。"if there is any small errors they accumulate over time."(只要存在任何微小错误,它们都会随时间不断累积。)

这意味着,单帧多逼真并不是决定性指标。一段 VR 体验里,门把手位置偏了一点、桌面纹理漂了一点,下一轮预测会把偏差继续放大;几分钟后,整个世界的状态可能已经不可用。生成式游戏、可自由漫游的 VR、机器人在线强化学习,真正需要的是记忆、长上下文和误差校正,而非只增加 4K 细节。

Germanidis 认为这不是无解的新问题:语言模型也曾难以生成长文本,后来逐步改善。但开放世界的退化更快,因为用户能做任意动作,模型不能靠预设剧情躲过难题。能连续生成半小时的角色,不等于能让玩家在同一世界里自由生活半小时。

7. 世界模型的终局不是更逼真的 RGB,而是跨模态迁移的科学底座

被问到为什么不立刻把语言、视频、音频和各种传感器统一成全模态模型时,Germanidis 没有否认方向,而是强调顺序:先解决机器人,再逐步纳入更多模态。RGB,即红绿蓝三通道图像,只是模型观察世界的一个起点,不是世界本身。他举的例子是 Refusion:研究者把 Stable Diffusion 微调到频谱图上——也就是把声音转成可视化的时间—频率图——便得到一个颇有能力的音乐生成器。

Runway 还试着把真实世界视频模型微调到物理、生物等领域的数值模拟数据上。这些数据原本可能是天体物理、原子尺度相互作用或其他系统的演化画面,视觉上和街头视频毫不相像;团队仍把它们直接当作 RGB 帧处理,并观察到比从零训练更快得到合理表现。"You're not just using RGB, you're using RGB as a starting point, but you can incorporate more and more modalities of the universe"(你不只是使用 RGB;RGB 只是起点,你可以纳入宇宙中越来越多的模态。)

这意味着,视频预训练学到的可能不只是“猫怎么跑、杯子怎么掉”,还包括一种更通用的能力:从连续变化的模式中找规律。只要不同领域存在可迁移的时空结构,视觉模型就可能成为稀缺科学数据的启动器。数据少的物理模拟、音频、传感器信号,不必每次都从零开始训练。

边界是,多模态统一模型仍有很多开放问题:不同模态如何对齐,哪些信息该共享,如何避免某一模态拖累另一模态,都需要谨慎处理。Runway 的近程优先级仍是机器人;“宇宙全模态模型”是它的方向感,不是现成产品。

把这 7 条放在一起看

“软件前端将从‘写代码’变成‘直接生成像素’”和“机器人缺的不是更多遥操,而是把第三人称视频变成预训练底座”,看起来分别属于软件与硬件,实际押注的是同一件事:视频模型不应只被当作内容生成器,而应被看作学习世界动态的机器。它既能预测用户点了按钮后屏幕如何变化,也能预测机械臂拿起物体后环境如何变化。

但这条路并不由画质单独决定。“生成质量越高,创作竞争越不在提示词,而在可控性和延迟”,说明模型必须能被人反复操纵;“能连贯几分钟不等于能生成开放世界”,又说明模型必须经得起长时间、开放行动的误差累积。再往后,“世界模型的终局不是更逼真的 RGB,而是跨模态迁移的科学底座”,把目标从一段好看的视频推向能处理更广泛现实信号的学习系统。

对读者而言,变化不只在于该不该用某个视频工具。更实际的问题是:你的工作里哪些部分依赖固定界面,哪些判断靠视觉经验,哪些流程因真实数据太贵而无法试错。前者可能被可生成的交互界面重写,后两者则可能成为世界模型最先进入的地方。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02