想用好AI的人,得先补好这三门基础课
如果你真的想要拥抱AI,你就绝不应该停滞对数学、物理、信息学的精进与学习。
我知道大家在AI时代或多或少会有焦虑,在推特上看到了很多AI公司之间的竞争,看到模型的升级迭代,这或许热血或荒诞,但是其实并没有改变信息的知识存量。
比起有什么东西不会就问AI,莫不如你开始自己有意识地搭建起数学、物理、信息的架构,这样你可以更好地理解智能,知道什么是本质,什么是噱头。
1.如果你有了数学的视角,神经网络不过是高维空间中的流形映射与优化。
无论是词向量还是隐空间,AI 处理数据的核心方式就是将现实世界的概念映射到高维连续空间。
梯度下降不只是代码里的,它是高维非凸曲面上的势能下降。损失函数的极小值点在哪里?流形是否存在坍缩?当你掌握了测度论与微分几何,你就能理解模型为何在某些维度上表现出惊人的泛化能力,
2. 现代 AI,尤其是深度生成模型与超大规模神经网络早已超越了传统统计学的静止范式,展现出非平衡态统计物理特征。
如今的Diffusion Models,其底层数学物理机制直接源于热力学中的非平衡态扩散过程与反向 Langevin 动力学。
生成一张图像,只是是从无序的高熵噪声状态,沿着概率流的梯度 field,一步步逆演回有序的低熵分布。
将神经网络视为由百亿级节点相互作用构成的复杂系统,你就能用统计力学的能量曲面去直观理解自组织以及泛化界的物理图像。
3. 学习的本质究竟是什么?信息论给出了最简洁深刻的回答。学习,就是无损或有损的压缩,而预测则是对信息熵的提纯。
为什么大语言模型普遍使用交叉熵作为损失函数?因为训练过程是在最小化真实世界数据分布与模型预测分布之间的 KL 散度。
从 Tokenizer 的设计到信息瓶颈理论,信息论定义了���能在表征效率上的理论边界。
当你对物理、数学、信息学有所认识,你会发现推特每一次沸沸扬扬的技术推进都会在你脑海中自动分类、标注层级。