近期,知名AI企业Runway正式发布了全新“界面世界模型”(Interface World Models)系列的首个重磅模型——Solaris。这一创新系统的诞生,意味着软件和网页不再依赖于预先写好的代码与固定框架,而是能够在你使用的过程中直接实时、逐帧地渲染出整个图形交互界面。
在传统的软件工程中,数字界面通常建立在两套割裂的系统之上:“知晓事物”的 AI 助手(如大模型和搜索引擎,擅长提供文本与图片等静态内容)和“实时响应”的传统程序(如游戏引擎和前端代码,擅长渲染动态效果,却对你的任务一无所知)。长久以来,每一个操作系统与应用之间的交互,都必须事先通过代码等中间表示进行明确定义,这无形中牺牲了视觉表现的丰富性,并将可能的操作空间严重“有损压缩”。

而 Solaris 的核心突破,在于将渲染和交互合二为一。它不再需要中间代码层的转译,而是作为一个单一的世界模型直接生成每一帧画面,并对用户的每一次输入做出即时、连贯的动态响应。用户在浏览虚拟服装店时,甚至可以直接以自己的照片为参考,像在现实中一样自然地拖拽衣架上的衣服试穿;或者通过一句简单的语音指令,让场景中的桌椅位置和物体颜色随光影实时演变。这种开放式、沉浸式的体验,让软件更像是一个鲜活的场景,而非冰冷脚本的堆叠。
这一革命性技术的背后,得益于底层架构的硬核创新。Solaris 建立在 Runway 的 Gen-4.5视频生成模型之上,并在速度、连贯性与成本控制三个维度实现了突破。首先,它通过自回归生成机制和多步去噪蒸馏,将原本需要数秒甚至数分钟的视频生成过程压缩至可以跟上人类操作节奏的实时运行速度;其次,通过大语言模型与世界模型的协同,大模型负责解读用户的意图并指导场景演变,而世界模型则负责视觉的实时渲染;最后,通过对快速模型的持续训练,模型在保持长会话和多步交互连贯性的同时,大幅降低了推理成本。
在客观的学术与用户评测中,Solaris 展现出了独特的优势。在对比多模态大语言模型仅凭截图重建界面的基准测试中,研究发现传统转译方式会随着视觉复杂度的提升而不可避免地丢失细节,而 Solaris 则从第一帧起便完美保留了界面的视觉与语义状态。在包含7500多次成对比较的用户研究中,参与者在遵循指令的准确度以及行为的自然度两项指标上,对 Solaris 的偏好度分别达到了61%和71%,远超传统编码界面孤立更新UI的表现。
当然,作为一项处于前沿的创新技术,Solaris 目前也面临着一些亟待解决的挑战。例如,高精度的实时文本生成仍是视频生成领域的一大难题;在长周期的开放式交互中维持视觉与语义一致性也需要进一步优化;同时,它还需要解决与现有屏幕阅读器和无障碍API等软件栈的集成问题。
尽管如此,界面世界模型的出现依然勾勒出了下一代计算平台的演进雏形。它有望彻底消除传统“应用”的边界,让软件根据用户的即时意图进行千人千面的动态重塑,从而彻底改变我们与数字世界的连接方式。目前,Runway 已面向核心合作伙伴开放该模型的抢先体验申请。
官网:https://runway.com/news/research/introducing-solaris


