AI Pulse

腾讯开源AI助手,看着屏幕自己操作软件

腾讯发布了一款开放权重模型,叫 UI-Mate-27B。它是一个图形界面代理,用来完成跨应用、跨系统的长时程任务。模型文件和代码已经公开,许可证是 Apache-2.0;GitHub 仓库和 HuggingFace 集合都挂在腾讯账号下。

它的工作方式挺直白:操作前先截屏,在可见状态上推理,然后输出结构化的鼠标和键盘动作。输入是任务指令、当前截图、历史交互记录,外加可选的演示上下文。输出是推理过程、一句动作描述和结构化的工具调用。动作空间涵盖鼠标、键盘、滚动、等待、请求用户交互和任务完成。

关键设计是实时屏幕定位:动作建立在当前屏幕内容上,而不是回放固定坐标。界面内容一变,模型就基于实时界面重新规划。

模型有两种模式。通用计算机使用:告诉它目标,它自己规划并执行。演示引导:先让它看一遍操作,再让它做同类任务。演示只当指导,不当固定脚本。

参数规模 27B,基础模型是 Qwen3.6-27B。训练分两步:先监督微调,再在线强化学习,都在可执行的 GUI 环境里完成。前一步学习指令和动作的对应,后一步靠试错优化动作序列。

接入成本不高。结构化动作和 pyautogui 兼容,脚本不需要重新定义动作层;还提供 OpenAI 兼容的 serving 和客户端接口,现成的 OpenAI 工具可以直接对接。Apache-2.0 许可证也允许个人开发者把模型部署到自己的机器上。

官方项目页给出的结论:在 Ubuntu 和 Windows 基准测试中表现突出,能跨多个应用长时间执行任务,也能从一次演示中学会程序化操作。

社区看法并不统一。有人拿 OSWorld 数据对比:UI-Mate-27B 约 77%,低于 Qwen3.8-27B 的 84%(那是另一个模型,不是这版的基础模型),也低于更轻量的 Holo3 的 78%。有人直接说 Qwen3.8-27B 强得多。还有一个词的评价:slop。

也有人关注实用价值。有人问演示视频是不是实时录制;如果是,速度相当快,或许真能当日常工具。一个正在做 TUI 的开发者说,总有些角落案例和界面不一致要手动调整,希望这个模型能替自己处理这些琐碎的事。

把 77% 和 84% 放在一起看,这是 OSWorld 上的成绩。长时程任务容错很苛刻,一步走错,后面很可能跟着错。UI-Mate 主打的正是长时程任务,这些数字到底说明什么,得等它在真实电脑上多跑几遍。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新