AI Pulse

ChatGPT替你操作邮箱日历,但得给完全控制权

ChatGPT替你操作邮箱日历,但得给完全控制权

OpenAI上个月发了个新东西叫ChatGPT Work。它不是普通聊天机器人,而是能直接操作你收件箱、Slack、手机、Notion、Figma的AI代理,最低订阅价每月20美元。

ChatGPT Work是公司编码工具Codex的修改版。OpenAI想让非工程师也能像程序员一样,扔给AI一个任务,它自己一步步完成,而不是只回答一个问题。

一位测试者让它干了几件事:从邮箱里翻出孩子幼儿园的奇怪日程表,加到Google日历;生成一份上市公司财务指标的自动更新仪表盘;建一个可查询的太空发射数据库;每周自动发一封最新AI研究论文的邮件。它连上Google日历可以创建事件,但不能创建新日历。

要让它替你做事,必须先给权限,但过程不顺畅。测试者想给云盘只设“读取”权限,反复报错,最后只能选完全访问。想让AI帮你做事,就得给它足够的控制权。

OpenAI不透露Work的具体用户数,但联合Codex应用有2000万人用,而ChatGPT在线版有超过10亿用户。内部研究显示,2024年6月,98%的OpenAI员工在用Codex,但外部组织订阅者只有17%,个人订阅者不到1%。这个差距说明,普通用户对让AI直接控制自己账户,还是挺谨慎的。

测试者20美元月费下,四天就用掉超过8000万tokens,按模型分析成本65美元——三倍多的订阅费。也就是说,OpenAI在补贴用户。最近他们刚把Luna模型价格降了80%,但密集使用成本压力还在,长期看要么涨价要么限制用量。

在AI代理编码工具赛道上,OpenAI并不领先。刚开发Codex时,工程师太依赖模型自主完成任务,而Anthropic的Claude Code更注重来回沟通,结果被证明更有效。以下载量看,Claude Code直到今年4月前都更受欢迎,之后Codex才略微领先。Databricks发现,一个叫Pi的开源工具用相同GPT 5.5模型时,在编码基准测试中表现优于Codex。OpenAI的工程师说他们不看竞争对手的产品,但测试者第一次启动ChatGPT Work时,系统就提示他导入Claude Cowork的数据。

OpenAI用自研的GDPval基准评估产品,涵盖44个职业和数百个知识工作测试,同时辅以用户反馈。

ChatGPT Work在技术上把AI代理能力往前推了一步,但权限设置的混乱、成本的不确定性、功能上的限制,说明这项技术离普通人日常使用还有距离。

阅读原文
📚 相关主题 商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新