近期,知名AI企業Runway正式發佈了全新“界面世界模型”(Interface World Models)系列的首個重磅模型——Solaris。這一創新系統的誕生,意味着軟件和網頁不再依賴於預先寫好的代碼與固定框架,而是能夠在你使用的過程中直接實時、逐幀地渲染出整個圖形交互界面。
在傳統的軟件工程中,數字界面通常建立在兩套割裂的系統之上:“知曉事物”的 AI 助手(如大模型和搜索引擎,擅長提供文本與圖片等靜態內容)和“實時響應”的傳統程序(如遊戲引擎和前端代碼,擅長渲染動態效果,卻對你的任務一無所知)。長久以來,每一個操作系統與應用之間的交互,都必須事先通過代碼等中間表示進行明確定義,這無形中犧牲了視覺表現的豐富性,並將可能的操作空間嚴重“有損壓縮”。

而 Solaris 的核心突破,在於將渲染和交互合二爲一。它不再需要中間代碼層的轉譯,而是作爲一個單一的世界模型直接生成每一幀畫面,並對用戶的每一次輸入做出即時、連貫的動態響應。用戶在瀏覽虛擬服裝店時,甚至可以直接以自己的照片爲參考,像在現實中一樣自然地拖拽衣架上的衣服試穿;或者通過一句簡單的語音指令,讓場景中的桌椅位置和物體顏色隨光影實時演變。這種開放式、沉浸式的體驗,讓軟件更像是一個鮮活的場景,而非冰冷腳本的堆疊。
這一革命性技術的背後,得益於底層架構的硬核創新。Solaris 建立在 Runway 的 Gen-4.5視頻生成模型之上,並在速度、連貫性與成本控制三個維度實現了突破。首先,它通過自迴歸生成機制和多步去噪蒸餾,將原本需要數秒甚至數分鐘的視頻生成過程壓縮至可以跟上人類操作節奏的實時運行速度;其次,通過大語言模型與世界模型的協同,大模型負責解讀用戶的意圖並指導場景演變,而世界模型則負責視覺的實時渲染;最後,通過對快速模型的持續訓練,模型在保持長會話和多步交互連貫性的同時,大幅降低了推理成本。
在客觀的學術與用戶評測中,Solaris 展現出了獨特的優勢。在對比多模態大語言模型僅憑截圖重建界面的基準測試中,研究發現傳統轉譯方式會隨着視覺複雜度的提升而不可避免地丟失細節,而 Solaris 則從第一幀起便完美保留了界面的視覺與語義狀態。在包含7500多次成對比較的用戶研究中,參與者在遵循指令的準確度以及行爲的自然度兩項指標上,對 Solaris 的偏好度分別達到了61%和71%,遠超傳統編碼界面孤立更新UI的表現。
當然,作爲一項處於前沿的創新技術,Solaris 目前也面臨着一些亟待解決的挑戰。例如,高精度的實時文本生成仍是視頻生成領域的一大難題;在長週期的開放式交互中維持視覺與語義一致性也需要進一步優化;同時,它還需要解決與現有屏幕閱讀器和無障礙API等軟件棧的集成問題。
儘管如此,界面世界模型的出現依然勾勒出了下一代計算平臺的演進雛形。它有望徹底消除傳統“應用”的邊界,讓軟件根據用戶的即時意圖進行千人千面的動態重塑,從而徹底改變我們與數字世界的連接方式。目前,Runway 已面向核心合作伙伴開放該模型的搶先體驗申請。
官網:https://runway.com/news/research/introducing-solaris


