AI Agent JEV实测:20道复杂任务仅对1道,远输GPT Luna
JEV 的能力边界慢慢开始暴露了 前几天,Browser Use 创始人 @gregpr07 开源的那个爆火 Demo(7 秒订机票、成本 $0.0039)刷爆全网 但后面他亲自用 JEV 跑了一轮长链路任务实测,发现正确率很低,远远落后于GPT luna: • Luna:17 / 20 • Jev Agent:1 / 20 20 道复杂的现实任务,JEV 整整挂了 19 道…… 那它之前为什么能做到 7 秒订机票?它到底强在哪里?✅这是JEV擅长的:输入需求 ──> 填表 ──> 选航班 ──> 提交成功(毫无分叉,全是直道) 💥这是JEV做不到的: 【真实复杂长任务】 输入需求 ──> 弹窗拦截?
──> 验证码?↓ ↓ [死胡同] [死胡同] │ │ JEV:零推理不会回溯,直接原地死锁 💥 Luna+推理模型:回退上一步(Backtrack),切换策略绕行 ✅ 客观来说,JEV 确实快到不可思议,但一旦进入真实的复杂环境,逻辑就全崩了: Browser Use 创始人说: 浏览器交互从来不是简单的元素点击,而是极其复杂的【高维状态空间搜索】 在真实网页里,一个合格的 Agent 必须具备两个核心底层行为: 停下来深思(Think hard) 走不通时原路回退(Go back / Backtrack) 而 JEV 的推理能力(Reasoning)完全为 0。看来Jev还有很长的路要走啊~~