Runway WorldPrompt:实时生成世界的控制层
Runway 正在把生成视频推向实时交互
Runway 近期推出了 GWM Worlds 2 的研究预览版,目标是把高保真视频与音频生成变成一种实时交互式模拟。Runway 将其称为“自回归扩散”模型,其中“自回归”强调模型会沿着时间连续生成内容。
这类系统通常被称为 世界模型:它不仅生成一段视频,而是尝试持续模拟一个可交互的环境,并根据用户动作或输入实时变化。
WorldPrompt 是什么?
GWM Worlds 2 中一个值得关注的新功能是 WorldPrompt。它可以理解为一种用于描述生成世界及其内部动作的输入格式。
它的核心能力包括:
- 固定模拟环境中的部分要素;
- 指定第一帧等初始条件;
- 创建一组带时间戳的事件;
- 在实时交互过程中继续输入动作提示。
换句话说,WorldPrompt 不只是给模型一句“生成什么视频”的提示词,而更像是一个用于控制世界状态、角色行为、镜头与环境变化的控制层。
更像游戏里的导演系统
Runway 的研究人员将 WorldPrompt 描述为一种控制世界中不同主体的方式,接近游戏中的控制逻辑。例如,一个非玩家角色可以在某个时间点走向用户并说话;模型则需要根据持续上下文生成对应画面与声音。
这意味着,WorldPrompt 试图把生成式视频从“一次性输出”推进到“可调度、可持续、可交互”的形式。它关注的不只是画面质量,还包括:
- 场景是否能保持一致;
- 角色是否能持续存在;
- 动作是否能按指定时间发生;
- 用户输入是否能实时改变模拟走向。
实时世界模型的竞争格局
Runway 并不是唯一投入实时交互世界模型的团队。该领域还有多个值得关注的项目,包括:
- Google DeepMind 的 Genie 3;
- Odyssey-2 Pro;
- World Labs 的 RTFM,即 Real-Time Frame Model。
其中,Genie 3 被提到可生成 720p、24fps 的交互内容。不过,这类系统仍有明显限制。Google 曾说明 Genie 3 目前支持的是“几分钟”的连续交互,而不是数小时级别的长期运行。
这也反映出实时视频与音频生成的难点:模型不仅要生成每一帧,还要在极低延迟下维持时序一致性、物体连续性、交互反馈和音画同步。
难点不只是生成,而是持续可控
传统视频生成模型通常面对的是一个相对封闭的问题:输入提示词,生成一段固定长度的视频。但实时世界模型的问题更复杂:
-
延迟要求更高
用户输入动作后,系统必须快速响应,否则就无法形成真正的交互体验。 -
上下文必须持续存在
一个角色、物体或空间布局不能在几秒后突然消失或变形。 -
事件需要可调度
如果用户希望某个动作在特定时间发生,模型需要理解时间线并执行。 -
多模态要同步
视频、声音、角色动作与环境反馈需要协调,而不是各自独立生成。
WorldPrompt 的价值正在于此:它试图把“提示词”扩展成一种更结构化的世界控制接口。
对创作工具意味着什么?
如果这类技术继续成熟,创作者使用视频生成模型的方式可能会发生变化。
过去,创作者主要是在提示词、参考图和后期剪辑之间反复调整。未来,创作者可能更像在配置一个实时舞台:先设定场景、角色与初始状态,再安排事件时间线,最后在运行过程中实时介入。
这可能影响多个方向:
- 交互影视;
- 游戏原型设计;
- 虚拟拍摄;
- AI 角色模拟;
- 教育与训练环境;
- 沉浸式内容创作。
不过,目前这些系统仍处于早期阶段。持续时长、稳定性、成本、延迟、可控性和评估标准,都还需要进一步验证。
小结
GWM Worlds 2 展示了 Runway 对实时交互生成世界的探索,而 WorldPrompt 的关键意义在于:它把提示词从“描述结果”推进到“控制过程”。
在世界模型领域,真正的挑战并不只是生成更清晰的视频,而是让生成环境能够持续存在、实时响应,并按照用户意图稳定演化。WorldPrompt 是朝这个方向迈出的一个研究性尝试。
