国内大厂集体重启AI,创业公司要遭殃了?
22 年 ChatGPT 发布以来,字节是第一个苏醒的大厂,在早期就奠定了Seed-火山-豆包权责分明的三角架构 今年以 WorkBuddy 为号角,腾讯也苏醒了,并且 hy3 的模型能力稳步上升,开始向流水高的应用侧蚕食。高返佣 + 密集地推的老一辈打法,虽然无赖但有效,创业公司慢慢回想起了大厂的恐怖 预计明年阿里和美团也会陆续恢复战斗力,对相关的高流水 Startup 可谓是毁灭性打击了
腾讯 WorkBuddy 搞了个 WorkBuddyBench,测 coding agent 能不能把真实的仓库、前端、办公、安全任务从头做到尾。 四条自建赛道:Code 80 题、Web 70 题、Office 50 例、Security 60 题。每个模型还在两个 harness 上各跑一遍——腾讯自家的 CodeBuddy Code 和 Anthropic 的 Claude Code,3 次取平均,think 模式。 腾讯办的榜,但自家一点没占便宜: · Code / Web / Office 基本被 Claude Opus 4.8 拿下(74.43 / 68.14 / 82.37) · Security 第一是友商智谱 GLM-5.2(76.32) · 腾讯自己的混元 HY-3,Web、Office 都咬到第二名,但一条赛道都没登顶 脚注还老实标注:Opus 在 Claude Code 上的 Code 分(77.90)是额外加了“别问、一次性做完”指令那次跑出来的,设置跟别人不完全一样。 结论:没有哪个模型通吃。