AI Pulse

金融分析师一小时才能做完的报告,现在五分钟就出来了

金融分析师一小时才能做完的报告,现在五分钟就出来了

Model ML做金融AI代理,创始人是兄弟俩,Arnie和Chaz Englander。两人之前两次成功退出,之后通过私人家族办公室做投资。投资这活儿有多耗时,他们算是亲自领教了,于是干脆写软件帮自己干。

Model ML的代理负责一整条工作流。从初始请求出发,经过研究、分析,最后交出一份可编辑的PowerPoint或Excel工作簿。给投资委员会做演示文稿,代理直接把简报和源材料变成可编辑的PPT。做电子表格,代理从客户模板或空白工作簿开始。接着收集数据,在多个工作表间搭公式和逻辑,最后套上金融行业的格式。一份完整的工作簿或财务模型就出来了。

代理怎么工作

核心代理负责规划、选工具、核对证据、跑计算。每一步分派给最合适的模型,多数时候是GPT-5.6 Sol。Model ML自建了一套文档工具,生成原生PowerPoint和Excel文件,来源可追溯。

Chaz Englander说,早期模型也能干活,但得由用户先把任务拆细,说明要什么输出。到了GPT-5.6 Sol,代理交出的东西已经很接近成品。

产品还有个特点。Model ML管这叫“表面无关”。任务从邮件或Model ML应用里开始,换到Microsoft Office插件继续,都不用重新解释。代理工作时始终带着原始简报,返回文件前还会逐张检查幻灯片。

一小时到五分钟

这家客户是全球资管公司。分析师手工做定制的一页报告,约一小时;现在约五分钟。另一个工作流里,代理一口气处理完虚拟数据室——超过10万行数据、数百个文件。

Chaz Englander希望用户把精力放在判断上:完善假设、打磨要点,不用重新搭建分析。数字可追溯,工作簿能重算,幻灯片可编辑,人直接进入审查环节。

基准测试里的对比

Model ML有个自己的评估框架,叫Composite,专测AI在金融服务场景的表现。它模拟完整流程:从金融简报出发,经过研究和计算,产出可编辑的文稿或表格。检查项包括数字、来源、公式、结构,还有视觉质量。模型跑在Model ML的代理框架里,配一套专门创建文档的工具。生成的幻灯片,图表和表格都能直接编辑。

PowerPoint工作流,GPT-5.6 Sol在100%的测试案例里交出可用演示文稿。Opus 5是76%。专业就绪率(输出能直接进入实质审查的比例)43.3%对26.7%。就绪样本的质量总分59.9%对56.7%。简报遵循度78.8%对77.9%,两边几乎持平。

从GPT-5.5到GPT-5.6 Sol,演示文稿的层次更清晰,设计也更一致。

视觉上,GPT-5.6 Sol没有全面领先。数据可视化78.8%对83.1%,布局75.9%对78.8%,视觉总质量77.9%对79.3%。一致性倒是占优:97.8%对93.3%。

Excel工作流,关键输出正确率83.3%对82.8%。所有关键输出都对的比例,GPT-5.6 Sol是50%,Opus 5是60%。输出定位和工作簿结构,两边都是100%。

更大的差距在效率上。每个工作簿的令牌消耗,GPT-5.6 Sol是244万,Opus 5是383万,少了约36%。令牌是模型处理文本的计量单位。耗时7.0分钟对7.5分钟。

演示文稿这边,GPT-5.6 Sol每份耗110万令牌,高于Opus 5的95.3万。对比Fable 5,完成率更高,令牌少约21%。

Composite的结果给了Model ML依据,把GPT-5.6 Sol扩展到生产环境。有些工作流之前是Opus 4.8在跑。

这些数字来自Model ML自己的评估。测的是代理框架、模型、文档工具这个组合,不直接等于客户体验。

模型调优

Model ML和OpenAI做过现场会议。两边追踪代理怎么规划演示文稿、怎么选工具、怎么维持上下文。结论用来改进代理指令,决定每个工具包什么时候加载。代理框架里,数据集成、文档编辑工具、技能、代码执行环境都是按需加载。

产品方向

Model ML的客户正在把输出搬到浏览器端,与背后的模型和源材料保持连接。平台能生成安全的交互式输出,可以持续更新,也可以锁定在某个时间点。审查者打开投资摘要,点一个数字,就能看到背后的财务模型,还能在同一页跟代理协作。

Chaz Englander有个判断:PowerPoint、Excel、Word是为手动创建知识工作的世界设计的。AI改变了这个前提,软件本身也要变了。

阅读原文
📚 相关主题 金融

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新