@_jasonwei改口:小模型靠工具不够用
当语言模型刚开始能很好地使用工具时,我赞同一种说法:我们不需要扩大语言模型规模,只需要一个足够强大的「认知核心」,比如说1B参数,剩下所有事情都可以通过工具使用来完成,比如浏览互联网或者执行代码。
我认为很多人都赞同这个论点,而且事实上,确实很难想出一个有意义的任务,从原则上讲,一个拥有充足工具访问权限的1B模型做不到。比如,大语言模型知道的任何冷知识,原则上都可以从互联网检索出来,再由1B语言模型进行推理。
但我现在认为这个观点完全错了,原因很简单:不靠工具使用快速自然地完成任务非常重要。我是在今年学习羽毛球的个人经历中领悟到这一点的。
在羽毛球方面,我就非常像一个「1B认知核心」。虽然我身体上能完成教练教我的每一个击球动作,但我需要耗费很多脑力记住每一个提示,再把它们组合起来。
实际练习中我几乎能完美完成一个击球,但我很难在一分球里全程保持,更没法在比赛中稳定发挥。这和那个练了一万次、能作为本能轻松完成动作的人显然不一样。
同理,语言模型把知识内化在参数里、不需要调用工具就能给出信息,这非常有意义。第一个原因是,我们显然在乎速度:你肯定更愿意立刻得到答案,而不是让模型花很长时间思考确认,或者去网页搜索。
第二个原因是,有些事情本来就最好通过对大量数据做反向传播来学习。如果你问人们一般怎么看Shambhala音乐节,你肯定更希望大语言模型基于互联网上所有数据给出一个汇总观点,而不是把网页搜索里靠前的三条评论直接复述一遍。
第三个原因是,要做大量工作才能找到答案,远不如本身就知道答案可靠。虽然理论上不一定是这样,但在实践中,至少现在来说,这大概率是对的。如果你总是要重新查事实、重新做数学推导,出错的概率就会更高,错误还会在长周期任务中不断累积。
一旦你认同不靠工具、用参数完成任务是有价值的,那你就必须认同「1B认知核心不够用」这个论点。1B模型能内化的知识量存在信息上限,而我们肯定希望AI能知道比这更多的知识。哪怕是1T参数可能都不够。
我们希望AI尽可能多地了解我们的世界,希望它能跟上新信息更新,我们对AI能为我们做什么的期待也会一直增长。
总结一下,工具使用能让小模型做到多得多的事情,但
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖