开发者0xcherry分享当前三项AI核心研究方向
我当前的工作主要有三个核心方向。第一个方向研究如何把任务转换成AI能够处理的结构,第二个方向研究如何提高token对系统正增益的转化率,第三个方向研究不同智力水平的AI模型如何同时为系统产生正增益。
关于第一个研究方向,已经得出相对明确的结论。可以将任务压缩重构为编码任务,再用编码工具链(Coding Harness)解决,这是典型的“拿着锤子找钉子”思路,OpenAlice和Auto Quant都是按照这个思路开发的。
第二个和第三个研究方向,是未来智能体工具链(Agent Harness)和递归自改进(RSI)的核心命题。理解这些命题可以用一个简单例子:如果你已经花200美元订阅AI,解决了生活中50%的问题,再额外花200美元,就能解决剩下50%的问题吗,答案大概率是否定的,剩余问题中很多是AI暂时无法解决的。
换一个更温和的问题:如果每月的AI成本从200美元提高到220美元,也就是提升10%,每月能多解决10%的问题吗。直觉上,多获得10%的token确实能提升推理质量,或是带来更多行动机会,增加token应该能解决更多问题。
如果这个温和命题成立,是否意味着只要多投入token就能解决更多问题,只是边际收益会出现衰减。再进一步,把每月的token消耗提高到2万美元,是不是就能解决95%的问题,直觉上这个更强的命题同样不成立。
结合两个直觉可以推理得出,在给定工具链(Harness)的前提下,系统中的问题存在一个AI能产生正增益的“甜区”。跨过甜区之后,token到正增益的转化率会快速下降,最终降到零。仅单纯增加token投入无法解决所有问题,工具链本身的优化同样重要。
描述衰减曲线的函数,自变量除工具链本身外,还要包含模型的智力水平。不同智力水平模型的衰减函数结构可能完全不同:发散性强的模型尾部衰减速度更慢,但早期很难快速完成改进;智力有限的模型可以在早期快速完成低要求任务,剩余任务的转化率会极速降到零。
如果在系统中同时搭配发散性强和执行能力强的两类模型,工具链的衰减曲线就能同时实现“前期推进够快,后期衰减够慢”的效果。目前社区最流行的Grok使用方法,就是用sol作为主驱动模型,本质是合并两个模型对系统的正增益能力,效果比单独使用grok或sol更好。
按照这个思路,如果把执行模型换成ds v4f,发散模型换成kimi k3,也能实现差不多的组合效果。红色线条大致就是一个足够优秀的工具链能实现的结果。