2026 年 8 月 31 日,Runway 在官方研究页发布 Solaris,称它是新一代“界面世界模型”(Interface World Model)系列的首个模型。它尝试跳过传统软件从设计稿到代码实现的转换过程,直接逐帧生成应用或网站的视觉界面,并让画面随着点击、拖拽和自然语言指令连续变化。
这不是把一张 UI 图做成动画。Solaris 的目标是让整张画面同时承担显示和交互:用户拖动家具,场景会持续重排;换一种材质,后续帧会保留物体关系并继续响应。Runway 认为,这种动态环境还能用于训练电脑操作 Agent,让它们不再只记住某个固定网页的按钮位置。
推理和渲染被拆成两层
Solaris 基于 Runway 的 Gen-4.5 视频生成模型改造,也延续了 GWM-1 世界模型路线。系统中,语言模型负责理解用户意图、判断场景该局部变化还是整体切换,并给出下一步行为;世界模型负责把决定实时渲染成连续画面。点击、拖拽等动作会像文字和图像提示一样,成为下一帧的条件。
为了把视频扩散从“几秒到几分钟生成一段”压到可交互速度,Runway 采用自回归逐帧生成,把多步去噪蒸馏成少数步骤,再让快速模型在自身输出上训练以维持长时间视觉稳定。官方给出的当前目标包括实时响应、会话内一致性和 720p 视觉质量。想先理解这条路线和普通视频生成的差别,可以看站内的 世界模型为什么是 AI Agent 的关键能力 (/article/1301-world-model-why-its-considered-the-next-key-capability-for-ai-agents-and-bots)。
官方评测说明了优势,也留下问号
Runway 用 30 个交互样例邀请 250 名参与者,收集近 7500 次成对判断。与 Claude Opus 5 生成的代码界面相比,Solaris 在“是否遵循交互指令”上获得 61% 的偏好,代码方案为 24%;在“行为是否自然”上,Solaris 获得 71%,代码方案为 21%。这是 Runway 自行设计和公布的评测,能说明视觉连续性上的潜力,但不能直接等同于生产软件的可靠性、性能或维护成本。
现阶段更像交互原型,不是代码替代品
Solaris 仍有四个明显边界。生成视频最难稳定的文字,恰好是界面最依赖的元素;错误但逼真的教学或商业画面会带来信任风险;长会话中的物体、语义和状态可能逐渐漂移;生成界面还要接入屏幕阅读器、无障碍 API 和既有软件系统。逐帧生成的成本也仍高于提供一次构建好的网页。
因此,Solaris 当前更适合沉浸式商品展示、可变化的教学演示、概念验证和 Agent 训练环境,而不适合直接承载支付、账户设置、精确表单等强确定性流程。Runway 目前正与合作伙伴推进公开发布,页面只开放早期访问申请。真正值得观察的不是“代码会不会消失”,而是视觉生成能否在文字准确、状态可追溯和无障碍支持上跨过软件工程的最低门槛。