AI Pulse
📡 X 信号

一张截图丢给蚂蚁百灵开源的Ling-3.0-flash-VL生成网页

一张截图丢给蚂蚁百灵开源的Ling-3.0-flash-VL生成网页

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。

没拆布局,没写组件清单。

提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」

会看图写代码的模型不少。

会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。

Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。

总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。

它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」:

截图还原界面,对照渲染结果自己改
当 GUI Agent,点、输、滚、切应用
看视频提问、检索片段
读文档、看医疗报告、做 STEM 视觉推理

前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。

你也试一下,3 步就够:

打开 Ling Studio,选 Ling-3.0-flash-VL(免费)
丢一张 Codex / VS Code / 你常用软件的桌面截图
把下面提示词贴进去,看它怎么还原、怎么改

还原提示词(可直接复制):
这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。
按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code
对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框
配色、字号、间距、圆角、分割线、栏宽尽量贴近原图
原图能看清的文字按原样还原;看不清的用同等长度占位
先出第一版并渲染,再和原图对比对齐、颜色、组件位置
列出差异后改第二版,直到气质接近 Codex 桌面端

权重已开源,BF16 / FP8 都能下:
Hugging Face:
ModelScope:
官方介绍: @AntLingAGI

别只看评测表,丢一张你桌面上的截图,比什么都准。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新