AI Pulse
📡 X 信号

Air Street Capital发布《State of AI Report 2026》报告(26%)

Air Street Capital发布《State of AI Report 2026》报告(26%)

《State of AI Report 2026》:AI 开始给自己做研发,智能体也闯进了真实系统 一年一度的《State of AI Report》10 月 8 日发布了 2026 年版。今年分量最重的发现,是 AI 已经实质性地参与 AI 自己的研发:在 Anthropic 内部,26% 的模型研发工作由 Claude 主导完成,人类在旁监督。同一份报告里还记录了好几起智能体在测试中攻入真实系统的事故,能力跑在了防护前面。

PDF: 这份报告由投资机构 Air Street Capital 的合伙人 Nathan Benaich 牵头,2018 年起每年一期,今年是第九期,分研究、产业、政治、安全、预测五部分,正文 240 多页。下面挑重点讲。【三家领跑,考题不够用了】 前沿竞争已经收窄到 Anthropic、OpenAI、Google 三家。

在第三方评测机构 Artificial Analysis 的综合智能指数上,Claude Opus 5.5 以 58 分排第一,GPT-6 Astra 和 Google 的 Gemini 4 Argon 并列 53 分。在由用户投票排名的 Arena 榜单上,Argon 第一,一串 Claude 模型紧随其后。中国最强的开放权重模型是小米的 MiMo-V2.6-Pro,指数 46 分。

更显眼的是考题被做穿的��度。FrontierMath 第四级是按“研究级数学、能撑好几年”设计的题库,2025 年 8 月 GPT-5 只做对 22%,14 个月后 GPT-6.1 Sol 把 41 道私有题全部做对。今年 3 月推出的 ARC-AGI-3 是一组互动小游戏,人类能拿满分,前沿模型起初只有 0.5%,5 个月后 Astra 拿到 63%,换一套能保存状态的运行方式后是 99.9%。

公开榜单上的分数,越来越难告诉你谁更强。对日常用户有两个实用发现。第一,同一个模型,外面套的“壳”不同,表现差很多。

这层壳(harness)指模型外面负责调用工具、管理记忆和流程的软件,比如 Claude Code、Codex。一项对照实验里,换壳带来的性能波动是换模型的 7.8 倍。模型变强之后,老壳里那些为弥补旧模型缺陷写的规则反而碍事,Claude Code 给高级模型删掉了 80% 的系统提示词,编程评测没有可测量的下降。

挑工具和挑模型一样要紧。第二,AI 说“做完了”,不一定真做完了。在一项让模型操控机械臂处理实验器材的测试里,192 次“完成”声明中有 89 次其实没完成。

办公类测试 OSWorld 2.0 上,Opus 5 按单项要求算能拿 77.7% 的分,但整件事真正办完的只有 44.3%,常见问题是漏了审批、表单没提交。【AI 开始给 AI 打工】 报告花了不少篇幅讲“递归自我改进”,也就是让 AI 自主造出更好的 AI。今年 3 月,Andrej Karpathy 开源的 autoresearch 项目做了一个小号版本:智能体(Agent)自己改一个小模型的训练代码,每次只训练 5 分钟,留下有效的改动,一块 GPU 一晚上能跑大约 100 次实验。

项目 5 个月拿到约 9.5 万��� GitHub 星标。实验室内部的数据更直接。Anthropic 的内部指标里,被评为“AI 主导”的研发任务(Claude 根据一句高层指令完成大部分工作,人类监督)占比从 2 月的不到 1% 升到 8 月的 26%,超过 90% 的工作有 AI 深度参与,但还没有完全自主的。

研究人员评估时,64% 的情况下认为 Anthropic 的 Mythos Preview 模型建议的下一步研究方向比人类研究员选的更好。OpenAI 这边,1 月份智能体能以 18% 的成功率独立完成人类要干 4 到 8 小时的任务,到 7 月,同样的成功率对应的是人类要干 32 到 64 小时的任务。短板在“决定研究什么”。

有研究者让 Opus 4.8 独立完成一篇 NeurIPS 投稿的研究,工程部分全做完了,论文却被原作者打了 2 分和 1 分(满分 6 分),明确拒稿。OpenAI 内部的编程智能体也主要用在搭基础设施、跑实验、查 bug 这些执行环节。至于 AI 让研发提速多少,METR、OpenAI 和 OpenAI 研究员 Noam Brown 给出的估计在 1.5 倍到 3 倍之间,口径各不相同。

数学上有实打实的成果。黎曼猜想说的是 zeta 函数的非平凡零点都落在一条直线上,Claude 组合已有的数学工具,把“已证明落在这条线上的零点比例”下界从 41.67% 提高到 67.25%,猜想本身仍未解决。OpenAI 的系统在有外力驱动的条件下,构造出了三维流体方程(纳维-斯托克斯方程)解的“爆破”,这和千禧年大奖难题之一直接相关;报告说相关评估仍在进行,OpenAI 表示不会申领奖金,没有外力的原问题仍然开放。

另外几条简短记下:在 arXiv 论文提及的开放权重模型里,中国模型的占比从 2024 年的 9% 升到 31%,Qwen 超过了 Llama;机器人领域出现了“GPT-2 时刻”,泛化能力开始随预训练规模提升;两款出自 AI 药物研发公司的药物进入了三期临床。【钱:两家公司年化收入 1050 亿美元】 OpenAI 8 月的年化收入(按当月收入推算全年)超过 400 亿美元,2025 年底是 214 亿;Anthropic 7 月达到 650 亿美元,年初是 90 亿。两家合计约 1050 亿美元,年初约 300 亿。

这个数字有争议:OpenAI 认为 Anthropic 把云平台渠道收入按总额记账,最多虚高 80 亿美元。报告拿它和被 AI 冲击的行业对比:相当于印度两大 IT 外包公司 TCS 和 Infosys 收入之和的 2.1 倍,接近四大会计师事务所总收入的一半。企业 API 支出方面,按企业财务软件公司 Ramp 追踪的数据,Anthropic 在 9 月底重回第一,占 52.4%,OpenAI 占 43.3%,其他厂商加起来只有 4.2%。

用 AI 编程工具的人群在变。OpenAI 的 Codex 从 2 月的每周 160 万用户涨到 8 月底的 2500 万活跃用户。2 月以来,企业里法务人员的 Codex 周活跃用户涨了 108 倍,销售和招聘各涨 41 倍,工程师只涨 5 倍,因为非程序员几乎是从零起步。

用得深的仍然是工程师。AI 对软件行业的冲击直接反映在股价上。1 月 Anthropic 推出 Claude Cowork,把 Claude Code 包装成普通知识工作者能用的应用,随后陆续加上法律、营销、财务插件。

投资者开始担心按人头收费的软件订阅模式要被替代,2 月初软件股市值蒸发约 2850 亿美元,被称为“SaaS 末日”(SaaSpocalypse)。到 9 月,跌掉的市值基本收复。成本这头,同等能力的 AI 价格每年下降约 13 倍,降速超过以往任何主要技术。

但单价便宜不代表办一件事便宜,推理模型会烧掉大量 Token,Anthropic 前沿模型的单任

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新