苏庭灏发布《Attention Projection Mixing with Exogenous Anchors》论文(17岁)
张小珺最新的一期节目,访谈了一位17岁的高中生,苏庭灏 这是香港一所国际学校的在读高中生,近期,他以独立研究者身份完成的论文《Attention Projection Mixing with Exogenous Anchors》被ICML经过双盲同行评审,正式收录为主会论文 ICML,是国际机器学习大会,是全球机器学习领域最重要的学术会议之一,每年,来自顶尖大学、科技公司和 AI 实验室的研究者都会把最新成果投到这里,经过双盲同行评审,再决定哪些论文进入主会 这篇论文解决了什么问题?Transformer处理一句话时,会不断把词语表示送进更深的层。层数越深,语义理解越复杂,但词语最初的身份信息可能逐渐被冲淡,这叫作过度平滑 已有方法会反复调用第一层的信息,让深层随时能够“回看原文” 但这里存在一个矛盾: 第一层需要生成稳定、适合长期复用的信息 第一层同时还要完成自己的语义计算 苏庭灏把它称为First-Layer Tension,也就是“第一层张力”,第一层承担两个目标,容易两头妥协 论文提出了ExoFormer,它在正常的Transformer 层之外,单独设置一个“外生锚点”模块 1. 从输入词向量中提取一份稳定表示; 2. 分别生成注意力的 Q、K、V 和门控信号G; 3. 每一层都可以将当前计算结果与这份锚点混合; 4. 混合比例由模型学习,也可以根据当前输入动态调整; 5. 锚点在注入前经过均方根归一化,避免不同层之间的数值尺度冲突。
可以把它想象成写一篇长文章: - 外生锚点负责保存“人物是谁、原始材料是什么”; - Transformer各层负责分析关系、提炼含义和形成结论; - 每一层都能查阅原始材料,深层计算无需长期背负所有基础信息 作者把这种分工解释为卸载假说:锚点保存词语身份,主网络集中处理高级特征 这篇论文的厉害之处: 1、发现了一个很具体的架构矛盾 2、把跨层复用扩展到了完整的Attention路径 3、效果提升比较明显,额外成本较小,在六项下游任务上,它的平均准确率从门控注意力的48.80%提高到 50.27%,验证集困惑度从14.64降到14.09 4、给出了可检验的机制解释 访谈中几个印象深刻的故事 1. 整篇论文大约做了200多次实验,花费约3万元,他也坦言,选择Attention并没有一条事先设计好的路线,多次测试后才找到第一层张力和外生锚点这个方向 2. 决定扩大实验规模时,他算出还要再花约 6000 元。那天晚上,他一直在犹豫。论文即使做得很好,也可能因为审稿中的不确定性被拒,这笔钱很可能换不来任何结果。
父母和哥哥支持他继续,他才把更大的实验跑了下去。论文署名只有一个人,研究能够完成,也离不开家人在经济和情感上的支持。3. 大约98%的工作由自己完成,没有导师指导,身边很少有人能和他讨论模型,最常交流的对象是ChatGPT、DeepSeek 和网上的课程 4. 他也很坦率地说,没有ChatGPT,自己很难完成这篇论文,比如怎么投稿、怎样回复审稿人、如何安排训练时间,他都会问AI 5. 他说自己希望成为一个能让自己开心,也能让喜欢的人开心的人,无论有没有AI,在他看来,“开心就是人类根本” 相关资料: 1、 2、 3、