开发者实测Grok 4.7修复代码漏洞 成绩不及多个竞品
开发者PawelHuryn针对Grok 4.7开展了真实工作场景下的代码漏洞修复测试。测试共用到2个代码仓库,预置了105个漏洞,要求模型尽可能找出并修复漏洞,共开展了3轮测试。
各模型最高得分如下:GPT-6 Astra(最高设置)拿到45分,Muse Spark 1.3(最高设置)拿到32.2分,Grok 4.7(高设置)和Grok 4.6(高设置)均拿到28.7分,Opus 5(最高设置)拿到27分,Qwen3.8-Max(最高设置)拿到25.7分。
测试中的105个漏洞并非随机选取,都是前沿模型在2026年初都没能解决的难题,只有预置漏洞计入成绩,不同模型系列的裁判会对照密钥给解决方案评分,未找出漏洞或解决方案不完整计0分。
后续补充测试显示,Grok 4.7仅在最高设置下以0.1分优势险胜Grok 4.6,在高设置和中等设置下得分均低于Grok 4.6。PawelHuryn认为Grok 4.7没有解决原有问题,只是针对热门基准测试做了优化,不是大家期待的模型。
PawelHuryn同时提到,他仍支持SpaceXAI,团队开发的适配VS Code的Grok工具已经开源,目前各应用市场安装量超过14万,同时支持Claude Code和Codex,桌面端也已上线。