AI Pulse
📡 X 信号

阿里高德开源LongHorizon-Harness,解决AI任务出错问题

阿里高德团队刚刚也开源了一个关于长程Agent任务的工具:LongHorizon-Harness,解决的是Agent自己判断自己的进展,错误会滚雪球的问题 它通过把任务状态管理从执行过程中分离出来,解决传统单一会话模式中的错误累积和上下文腐烂问题 一句未经核实的声明和事实长得一模一样,Agent没法区分,一旦一个错误前提进入了记录,后面每一步都建立在这个错误上,那么目标漂移、重复尝试、提前放弃,都是同一个根因 LongHorizon-Harness核心方案是MEA循环,它把一次长程任务拆成三个角色,Manage、Execute、Audit(管理、执行、审计) 循环,各干各的互不干扰 三个角色可以分别配置不同模型,比如Manager用轻量模型,Executor用强模型 关键机制:只有审计者能更新任务状态,且必须基于对环境的独立验证,审计报告是跨轮次的唯一记忆 效果上,使用相同模型(Qwen 3.7-Plus)和相同执行后端,仅替换框架后: WeaveBench,通过率从51.8%提升至 80.7%(+28.9) OSWorld 2.0,完成率从2.8%提升至8.3%(3倍) Terminal-Bench 2.1,成���率从69.7%提升至77.2%(+7.5),token消耗减少24% Qwen 3.7-Plus配LongHorizon-Harness的一些指标甚至超过了Claude Opus 4.7裸跑Claude Code 同时支持GUI桌面操作和CLI命令行,一个任务可以在浏览器、终端、桌面软件之间无缝切换 #LongHorizonHarness #Harness #长程agent

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新