AI Pulse

AI自主提交了团队65%的代码,人类只需设目标

AI自主提交了团队65%的代码,人类只需设目标

Anthropic 的 Claude Code 产品工程团队最近 65% 的 PR 是由 Claude Tag 提交的——这是一个嵌入 Slack 的 AI 代理。它默认支持多人协作,能设长期监控任务,还带着团队记忆。在 Claude Code 团队里,AI 已经是主动的生产者,不是被动工具。

非程序员也能用它。市场营销团队拿来查公司内部信息、了解功能细节;设计、工程等不同角色可以在同一场会话里协作。Anthropic 内部公开工作的文化是关键——Claude Tag 在公共 Slack 频道里最好使,鼓励大家在公开频道协作,而不是私聊。

AI 怎么安全地自主工作

Anthropic 很相信 auto mode,把它看作 Claude Tag 的使能技术。auto mode 下,AI 不用每步都等你批准,自己能调用工具、执行命令、改文件。它今年 3 月 24 日首次公开,Anthropic 内部从 1 月就开始用了。内部几乎所有人都在用 auto mode,经过了几千次 eval 和外部红队测试。Anthropic 说,所有发现的 prompt injection 问题都已经修复。

背后是一个 Sonnet 分类器在持续判断每次工具调用和对话上下文,实现动态权限管理。它和沙箱基础设置配合:当某个操作需要逃逸沙箱,比如发起网络请求,分类器会判断合不合理。工具本身也支持 credential injection——代理可以访问 Datadog 等外部服务的凭证,但自己攥不住这些凭证。

关键变更还是需要人工审。Claude Code 的系统提示有代码所有者审查,外层代码就交给 Claude 自己写的代码审查机器人全权处理。出了意外时,Anthropic 通过 incident review 把导致问题的 PR 加入 eval 集。新模型发布时,它会跑整个 eval 集,确保严格胜过旧模型。

AI 怎么改变日常工作

Claude Code 产品团队的 Cat 说,随着模型迭代,她已经不用盯着每个步骤了,可以把琐碎实现都丢给 Claude,腾出时间做创造性的事。Thariq 建议程序员别被 AI 的编码能力吓住——用更雄心勃勃的工作去抵消那种 Deep Blue 感。当 AI 在编码上胜过人,别跟自己谈判,直接转向更难的事。

重写代码现在可行了。Thariq 支持重写,内部已经把 Bun 运行时从原始版本重写成了 Rust。这事真发生了:Anthropic 从 6 月 17 日开始向所有用户推送基于 Bun-in-Rust 的 Claude Code。远程控制功能也出乎意料地受欢迎——用户从客厅用手机控制 Claude Code。

提示方式在变

系统提示的写法变了。对 Fable 或 Opus 4.8 这些最新模型,在系统提示里加示例已经不是推荐做法。Claude Code 的系统提示最近减少了 80%。列出“不要做 X 和不要做 Y”的指令,反而会降低最新模型的回答质量。旧模型还是用完整系统提示。

优化主要针对能力,但 Anthropic 也在建行为 eval 来抓用户不喜欢的行为,比如 AI 在深夜跟程序员说“该睡觉了”。不同模型用不同系统提示——前沿模型用精简版,旧模型用完整版。

AI 能做的远不止编程

Fable 能剪视频。Thariq 用它编辑了自己的发布视频:Fable 自动转录,动态裁剪舞台上的发言人,用 HTML 源替换幻灯片,背后用了 ffmpeg 和 Remotion。Thariq 用 Claude Code 做了 2D 格斗游戏,包含他自己和朋友的角色。Cat 用 Claude Code 建了攀岩日志应用,用来规划旅行和团队活动。

Claude Tag 的多人会话支持跨角色协作。一场设计评审可以是一次会话:工程师先拉 Claude Tag 做初稿,再让设计师介入。会话记忆是频道特定的——每个频道有一个共享的 markdown 文件。

Anthropic 内部先向员工发布功能,只有达到用户留存标准才会公开。内部把 dogfooding 叫做“ant fooding”。团队和模型训练团队紧密合作,定期讨论下一代模型的能力预期。

Thariq 说,希望 AI 能更多跟真实世界互动:“它能解决科学问题吗?它能编排实验吗?” 他还希望工具设计更像艺术或生物学,而不是科学。

阅读原文
📚 相关主题 产品开发

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部