BangzhengL发布SEAR 基准测试和框架(4+)
Astra 控制机器人令人惊叹?事实证明其他大语言模型也能做到——甚至是像 DeepSeek 这样仅支持文本的模型。
我们还发现,Astra 在实时观察和纠正每一步动作上表现最佳;Fable 在预先用代码构建自己的工具和策略上表现最佳。
我们推出了 SEAR,这是一个全新的基准和框架,用于严格评估和研究大语言模型智能体如何在机器人上自我进化。
🔁📈循环过程:在受控时间预算内,智能体及其库更新策略 → 策略在仿真或硬件上运行 → 评判器返回反馈 → 库将技能和经验带入下一个任务。
💻🚏自我进化智能体的运作方式多种多样——我们一次性对所有方式进行了研究:策略可以是智能体编写的代码(代码即策略),也可以是控制循环中的智能体本身(智能体即策略),或者是它训练得到的视觉语言动作模型(自动研究)。
🧑🔬🤖我们在仿真和真实硬件上累计花费了超过 4 年的智能体进化时间,在 330 个仿真任务、2 个物理引擎,以及不同配置的真实机器人上,测试了 7 个前沿模型(GPT-6-Astra, Fable 5.1, Opus 5, GPT-5.6-sol, Gemini-3.6-flash, Kimi-k3, DeepSeek-v4-flash)。
🌐项目概述:主题帖 🧵1/5
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖