Runway WorldPrompt:实时生成世界的控制层

Latent Space1 天前

Runway 正在把生成视频推向实时交互

Runway 近期推出了 GWM Worlds 2 的研究预览版,目标是把高保真视频与音频生成变成一种实时交互式模拟。Runway 将其称为“自回归扩散”模型,其中“自回归”强调模型会沿着时间连续生成内容。

这类系统通常被称为 世界模型:它不仅生成一段视频,而是尝试持续模拟一个可交互的环境,并根据用户动作或输入实时变化。

WorldPrompt 是什么?

GWM Worlds 2 中一个值得关注的新功能是 WorldPrompt。它可以理解为一种用于描述生成世界及其内部动作的输入格式。

它的核心能力包括:

  • 固定模拟环境中的部分要素;
  • 指定第一帧等初始条件;
  • 创建一组带时间戳的事件;
  • 在实时交互过程中继续输入动作提示。

换句话说,WorldPrompt 不只是给模型一句“生成什么视频”的提示词,而更像是一个用于控制世界状态、角色行为、镜头与环境变化的控制层。

更像游戏里的导演系统

Runway 的研究人员将 WorldPrompt 描述为一种控制世界中不同主体的方式,接近游戏中的控制逻辑。例如,一个非玩家角色可以在某个时间点走向用户并说话;模型则需要根据持续上下文生成对应画面与声音。

这意味着,WorldPrompt 试图把生成式视频从“一次性输出”推进到“可调度、可持续、可交互”的形式。它关注的不只是画面质量,还包括:

  • 场景是否能保持一致;
  • 角色是否能持续存在;
  • 动作是否能按指定时间发生;
  • 用户输入是否能实时改变模拟走向。

实时世界模型的竞争格局

Runway 并不是唯一投入实时交互世界模型的团队。该领域还有多个值得关注的项目,包括:

  • Google DeepMind 的 Genie 3;
  • Odyssey-2 Pro;
  • World Labs 的 RTFM,即 Real-Time Frame Model。

其中,Genie 3 被提到可生成 720p、24fps 的交互内容。不过,这类系统仍有明显限制。Google 曾说明 Genie 3 目前支持的是“几分钟”的连续交互,而不是数小时级别的长期运行。

这也反映出实时视频与音频生成的难点:模型不仅要生成每一帧,还要在极低延迟下维持时序一致性、物体连续性、交互反馈和音画同步。

难点不只是生成,而是持续可控

传统视频生成模型通常面对的是一个相对封闭的问题:输入提示词,生成一段固定长度的视频。但实时世界模型的问题更复杂:

  1. 延迟要求更高
    用户输入动作后,系统必须快速响应,否则就无法形成真正的交互体验。

  2. 上下文必须持续存在
    一个角色、物体或空间布局不能在几秒后突然消失或变形。

  3. 事件需要可调度
    如果用户希望某个动作在特定时间发生,模型需要理解时间线并执行。

  4. 多模态要同步
    视频、声音、角色动作与环境反馈需要协调,而不是各自独立生成。

WorldPrompt 的价值正在于此:它试图把“提示词”扩展成一种更结构化的世界控制接口。

对创作工具意味着什么?

如果这类技术继续成熟,创作者使用视频生成模型的方式可能会发生变化。

过去,创作者主要是在提示词、参考图和后期剪辑之间反复调整。未来,创作者可能更像在配置一个实时舞台:先设定场景、角色与初始状态,再安排事件时间线,最后在运行过程中实时介入。

这可能影响多个方向:

  • 交互影视;
  • 游戏原型设计;
  • 虚拟拍摄;
  • AI 角色模拟;
  • 教育与训练环境;
  • 沉浸式内容创作。

不过,目前这些系统仍处于早期阶段。持续时长、稳定性、成本、延迟、可控性和评估标准,都还需要进一步验证。

小结

GWM Worlds 2 展示了 Runway 对实时交互生成世界的探索,而 WorldPrompt 的关键意义在于:它把提示词从“描述结果”推进到“控制过程”。

在世界模型领域,真正的挑战并不只是生成更清晰的视频,而是让生成环境能够持续存在、实时响应,并按照用户意图稳定演化。WorldPrompt 是朝这个方向迈出的一个研究性尝试。

评论

请登录后发表观点

暂无数据