AI Pulse
📡 X 信号

用户实测AI互查发现错误 OpenAI新模型方向指向自主任务

用户实测AI互查发现错误 OpenAI新模型方向指向自主任务

有用户分享实测,让Claude整理8月21日美股收盘的三大指数涨跌幅,再拿给Codex复查。Codex指出数据有误,Claude给出的是盘中数据,并非收盘数据。

核对官方资料后,确认Codex结果正确。Claude误将上午中段的行情快照当作收盘数据使用。

这件事说明,如今的AI智能体(AI Agent)已经可以完成查证类工作。查证不同于普通回答问题,需要AI自行查找来源、比对时间戳、发现矛盾,再判断内容可信度,这类多步骤任务完成过程中不能偏离目标。

OpenAI的下一个主力模型Astra,发展方向正好对应这类能力。Astra在8月1日由官方宣布,目前尚未发布,没有公布价格、发布日期,甚至最终是否命名为GPT-6也未确定,网上流传的模型规格均为未证实消息。

官方仅确认一点:Astra在智能体编码(Agentic Coding)和网络安全领域有明显进步,进步程度已经无法排除它跨过“Critical等级”门槛。

官方对Critical等级有明确定义:模型需要能够在经过加固的真实系统中,全程不需要人工介入,独立找出漏洞并写出漏洞利用程序,或是针对目标设计并执行端到端的攻击策略。核心要求是不需要人工介入、完成端到端任务。因此Astra的发展方向不是让AI更聪明,而是让AI可以独立完成完整的多步骤任务。

对于美股和币圈研究工作,这类能力会带来四个具体改变。第一,不需要人工盯盘,可以设置条件让AI每日自动运行,出现异常情况再通知用户。

第二,交叉查证会成为默认动作,对同一数据自动对接多个来源核验,发现矛盾主动报告,不需要用户产生疑问后再手动核查。

第三,AI可以自动维护对账记录,按照要求每日收盘自动比对,不需要人工记录整理。

第四,财报季可以批量完成分析任务,对多家公司使用同一套分析流程,仅消耗运行时间即可完成。

这些改变不是因为AI变得更聪明,而是AI可以独立完成多步骤任务,帮人节省时间和精力。

使用AI智能体不代表可以无脑完全授权。敏感信息和重要决策,交付AI处理后仍需要人工确认。

查看交易所只读API的余额持仓可以授权AI,修改本地文件、发送内容之前一定要人工检查。完全可以交给AI的工作包括搜索资料、整理财报、运行分析、追踪信息矛盾等。

凡是涉及资金支出、不可逆操作、以个人名义发布的内容,都需要人工做最终确认。AI可以提升研究效率,必须以安全为第一位。Astra如果正式上线,会给很多人的工作带来质的提升。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新