现在AI还没有能解释大模型整体行为的统一理论
今天聊了这么多金融系统、理论物理,控制论,我在此回到正题:人工智能。
实际上 ,AI 已经拥有大量成熟理论,比如统计学习理论、信息论、优化理论、计算学习理论、深度学习理论等等。
现在的问题是,这些理论还没有被统一成一个能够解释现代大模型宏观智能行为的理论体系。
举个例子,就像 19 世纪并非不是没有物理学,只是牛顿力学无法解释热力学现象,新的理论体系尚未完成。
机器学习、深度学习只是局部理论。我们人类,现在拥有大量局部理论。
我列出如下问题:
为什么计算会产生智能?
为什么规模会产生涌现?
为什么微观参数最终形成宏观能力?
为什么信息会产生语义?
为什么系统会出现推理?
为什么物理过程最终能够产生意识?
这些问题其实已经超越了单纯的 AI。
我想现在的人类正在逼近一个更大的问题,自然界,我们的世界,为什么能够从简单规则中产生越来越高层次的结构?
从粒子到原子,从原子到分子,从分子到生命,从生命到神经系统,从神经系统到意识,从意识到文明。
我看到的趋势是,人类似乎正在尝试反过来,即从计算系统重新制造智能。
所以 AI 可能第一次让人类能够实验性地研究智能是如何诞生的。
关于transformer,我认为它不是智能的祖师爷理论,它更像是一个极其成功的工程范式。
Attention is All You Need那篇论文解决的,我们可以构造能够高效处理序列信息、学习复杂表示并进行生成的神经网络架构。
但是它并没有能力回答上述我总结的问题。
你可以把Transformer ≈ 蒸汽机。
当然,你也别低估这个蒸汽机。Transformer架构虽然可能不是最终理论,但它绝对是历史上极其关键的实验装置。
若干年后,人类社会未来发现真正伟大的大一统理论,是因为 Transformer、扩散模型、推理模型、Agent 等工程系统已经把大量异常现象摆在了面前。
工程先制造现象,理论再解释现象。我早已强调。
如果真的有人做到了,写出一个统一方程或理论,把现在 AI 中分散的 Scaling Law、泛化、涌现、表示学习、深度学习、优化、推理、上下文学习、幻觉等现象放进同一个理论框架,我会定义那是21 世纪最重要的科学事件之一。