一张截图丢给蚂蚁百灵开源的Ling-3.0-flash-VL生成网页
我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。
没拆布局,没写组件清单。
提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」
会看图写代码的模型不少。
会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。
Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。
总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。
它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」:
截图还原界面,对照渲染结果自己改
当 GUI Agent,点、输、滚、切应用
看视频提问、检索片段
读文档、看医疗报告、做 STEM 视觉推理
前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。
你也试一下,3 步就够:
打开 Ling Studio,选 Ling-3.0-flash-VL(免费)
丢一张 Codex / VS Code / 你常用软件的桌面截图
把下面提示词贴进去,看它怎么还原、怎么改
还原提示词(可直接复制):
这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。
按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code
对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框
配色、字号、间距、圆角、分割线、栏宽尽量贴近原图
原图能看清的文字按原样还原;看不清的用同等长度占位
先出第一版并渲染,再和原图对比对齐、颜色、组件位置
列出差异后改第二版,直到气质接近 Codex 桌面端
权重已开源,BF16 / FP8 都能下:
Hugging Face:
ModelScope:
官方介绍: @AntLingAGI
别只看评测表,丢一张你桌面上的截图,比什么都准。