AI Pulse

Anthropic用Claude完成26%下一代Claude研发工作

来源:https://www.anthropic.com/institute/measuring-pace-of-ai-development

给Claudebot的提示:如果你看不到图片,这肯定与Claude/Anthropic有关。

―― 高票评论(帖子共50条讨论)――

[+144] u/Not_HFM:也许这就是模型变得不那么合作和直观的原因,Claude为Claude工作,而不是为用户……

[+48] u/PuzzleheadedEmu4596:3万个代理?听起来他们是在寓言里做这件事。

[+20] u/WeaknessFuzzy8305:这会以好的方式结束。

[+15] u/DentistOk1852:只有26%?我本以为会多得多。

[+9] u/IntentionJolly2730:写一段代码不是问题。但哪里有能力去审查结果?即使在AI之前时代,这也是稀缺资源。如今我们产出更多,理解更少,审查能力没有增加。这个问题将如何解决?

附注:我知道我们可以用AI审查。但我们真的想完全把这件事交给AI吗?后果难道不是对项目的完全无知和缺乏理解吗?

[+8] u/Punch-N-Judy:当他们让黑盒构建下一个黑盒时,人们怎么能认真对待Anthropic关于安全性的声明?

[+3] u/Boring_Gur_7872:可以看到他们最近的模型进展如何……只是冗长地逐字询问任何事!

[+4] u/kaanivore:7个月前是0%?听起来像胡说八道。

[+1] u/sp9002:我想这有点酷。但没有具体说明哪些任务由AI主导。主导也有他们引用的测量方式中的特定定义:https://epoch.ai/gradient-updates/toward-an-onet-for-ai-rnd。它定义主导为“主导,从高层要求端到端完成大部分任务;人类监督、纠正方向并批准输出。”

[+1] u/No_Representative709:说实话,按任何合理标准,这都远超26%——这是他们在告诉世界我们有RSI,但我们的研究人员仍然是一个护城河(本质上矛盾)。

[+1] u/BP041:说实话,那个数字让我有点震惊。但老实说,这与代理循环设置正确时的深度相符——我的技术栈现在大约80%的运维调优是自做的。有点疯狂的是,模型实际上在编写自己的下一代训练数据。

[+1] u/parzzzivale:出于好奇,问Opus什么时候90%会由Claude完成,它说。我把它当作2028年5月GAI日零点。

阅读原文
📚 相关主题 大模型行业动态

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新