@dawnsongtweets发布CUA-Lite计算机使用Agent开放平台
隆重介绍 CUA-Lite 🧵——一个面向计算机使用智能体的开放平台。
训练和 benchmarking CUA(计算机使用智能体)需要四个核心部分:
1️⃣ 智能体——模型,以及驱动模型的脚手架
2️⃣ 环境——供智能体交互的运行时/沙箱,以及任务与验证器/评分器
3️⃣ 轨迹——智能体行动轨迹的记录
4️⃣ 框架——用于评估、监督微调 SFT 和强化学习 RL 训练智能体
如今,这四个模块全都支离破碎。每个智能体都自带单独的实现,通常还放在不同仓库里——没有统一的方式可以运行全部智能体。每个环境都暴露自己独有的接口和动作空间,每个可验证任务往往都需要一个昂贵的虚拟机沙箱。轨迹的格式互不兼容。
由于整个技术栈没有通用标准,每个项目最后都得重新搭建自己的工具/框架来做评估、监督微调和强化学习。
CUA-Lite 统一了整个技术栈:
→ 为智能体和环境提供一套标准化接口与动作空间
→ 为智能体轨迹提供一套标准化格式
→ 提供统一框架完成评估、监督微调和强化学习
→ 覆盖桌面端、浏览器与移动端
开放资源可以直接接入,由此形成了最大的开源 CUA 智能体、环境与轨迹集合,全部采用统一格式:
🤖 10+ 款 CUA,包括 GPT、Claude、Gemini、Qwen、Muse-Glimmer、UI-TARS
🌐 15+ 个基准测试,包括 OSWorld、WebArena 与 AndroidWorld
⚡ 可选的无虚拟机沙箱,自带 30K+ 个可验证训练任务
📚 10+ 个轨迹数据集,在 Hugging Face 免费开放,包含转换为标准化格式的公开数据集,以及前沿开源权重 CUA 新生成的轨迹
本项目由 @BerkeleyRDI 牵头,我们的目标是让 CUA-Lite 成为社区驱动、面向计算机使用智能体的开源生态。
今天就加入社区贡献吧:带上你的环境(运行时/沙箱 + 任务 + 验证器)、轨迹或智能体,接入 CUA-Lite 即可!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖