AI Pulse
📡 X 信号

Runway发布Solaris 界面世界模型

Runway 昨天发了个新东西,叫 Solaris,官方定位是第一个“界面世界模型” 一句话说清楚:界面不再是写出来的代码,而是 AI 逐帧实时生成出来的 它动的不是“生成内容”这一层,而是“软件本身”这一层,这可能是 Runway 至今最激进的想法 它要解决的问题是:今天所有软件都要经过一次翻译,视觉设计先转成代码才能跑,Runway 管这叫“有损压缩” 他们测过:给最强的多模态模型一张网页截图让它重建,每个模型都丢信息,页面越复杂丢得越多,证明语言和代码天然装不下视觉信息 Solaris 干脆不要中间层,整个画面帧就是界面本身,每一帧都根据点击、拖拽、输入现场合成。它基于 Gen-4.5 视频模型,把用户输入当成下一帧的条件信号,把几十步去噪蒸馏成几步做到实时,再用一个语言模型负责“应用该做什么”、世界模型负责“行为长什么样” 我觉得这个推理和渲染分离,是全文最聪明的设计 数据也值得看。250 人、约 7500 次成对判断,和写代码的 Claude Opus 5 对比:指令遵循 61% 对 24%,自然行为 71% 对 21% 代码界面把每次操作当孤立更新,Solaris 理解物体该怎么动,交互融在场景里,这是“页面更新”和“世界反应”的区别 我更想提醒���低估的一面:Solaris 还能训练 agent 现在最好的大模型连订酒店都常翻车,因为文本模型学的是被训练过的那个布局,换个网站就不认得。

Solaris 能持续生成从没存在过的布局,这条路走通,它最大的客户可能不是设计师,而是各家的 agent 训练管线 警惕的部分。Runway 承认四个短板:文字渲染不稳定、信任问题、长会话一致性、无障碍。我的判断是短期最先落地虚拟试衣、产品演示、互动教学这类体验型界面,表单、交易类场景很长时间碰不了,别指望它短期替代现有产品。

什么情况下我会推翻判断?实时文字稳定可读,且逐帧渲染成本降到比托管静态页面还便宜。两条都兑现,被改写的就是整个前端工程这个职业;兑现不了,它就停留在一个很酷的 demo 想体验,官方有 early access 申请表,To B 导向。

重点感受“用自然语言描述交互”,那是下一个界面范式的真实信号;工程师则盯着另一件事——当鼠标被重新定义,最先贬值的不是写代码的能力,而是你在特定框架上攒下的经验

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新