AI Pulse
📡 X 信号

Sakana发布无反向传播的PC-ALM深度学习法

Sakana发布无反向传播的PC-ALM深度学习法

介绍PC-ALM,一种反向传播的本地学习替代方案。我们的方法仅使用本地动态训练 1000 层神经网络,不需要反向传播。

博客:
标准深度学习依赖反向传播。然而,大脑无法实现反向传播,至少无法精确实现。像大脑这样的物理系统,如何在不显式使用反向传播的情况下解决多层信用分配问题?

我们从两个相关领域寻找灵感:分布式优化和NeuroAI。在 NeuroAI 中,预测编码要求每个神经元激活都解决一个基于能量的推理问题,而不是使用标准前向传播。

该推理步骤可以实现为基于本地预测误差的能量最小化动态。这种将每一层视为动态系统的观点已被证明很有前景,但预测编码的性能并没有随深度很好地扩展。网络远端的信用信号很难扩散到内部层。

我们转向分布式优化,将预测编码泛化为使用增广拉格朗日函数而非能量。这个动机可以追溯到 LeCun 在 1988 年发表的一篇经典论文,该论文指出深度网络的拉格朗日乘子可以与监督损失的梯度对应起来。

然后增广拉格朗日函数将 LeCun 的观点和 NeuroAI 中使用的标准预测编码连接起来。我们发现,这个新观点自然产生了一个类似PC的反向传播替代方案,我们将该方法称为PC-ALM。

PC-ALM 与 PC 的不同之处在于,它将对偶神经元(拉格朗日乘子)作为层本地动态的一部分引入,使得每一层都充当 PI 反馈控制系统,以最小化本地预测误差。

我们发现,PC-ALM 能够将信号传播到看起来任意的深度,尤其是在标准 PC 难以学习的深度窄网络中。

归根结底,我们在这里的动机是理解像大脑这样的分布式物理系统如何仅使用本地耦合和本地动态来计算信用信号。PC-ALM 也可能为神经形态硬件中的深度学习提供信息,因为神经形态硬件中的动态比 GPU 上更便宜。

论文:
代码:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新