Google发布Agent技能库相关研究论文(99%)
Google 这篇新发布的论文简直就是一篇神文,如果要给你的Agent建一个skill库,请务必收藏! 感觉这篇论文把 99% 做 Agent 和个人知识库的人全骂了一遍哈哈, 你以为越记越多是在进步,其实把执行记录、复盘认知和操作手册混在一坨,根本不可能产生复利, 好手册能让 9B 小模型直接干翻 27B 裸跑, 但弱者写的一身笨补丁,能把顶级大模型活活毒死 Google 团队在 WikiSkill 里给出了极其残酷的几组真相: 1️⃣ 战术可以失败回滚,但对失败的理解必须永久焊死: 真正厉害的系统必须物理拆成三层: 原始轨迹只读归档、复盘认知只增不减、执行手册随时修补回滚, 前人把探索教训散落在对话框里,每次遇到问题都像失忆一样重新踩坑, 打法验证变差可以撤回,但踩坑认知必须留下,复利才会真正爆发; 2️⃣ 小模型靠手册逆袭,大模型吃手册更狠: 9B 模型配上进化出的结构化手册,表现直接干翻 27B 裸跑, 而在复杂表格任务上,27B 模型加上手册更是直接从 40% 狂飙到 81%, 程序性知识的差距,早就超越了单纯堆参数的裸智力差距; 3️⃣ 弱者的妥协是强者的毒药: 小模型为了防止自己翻车写的一堆单行脚本和保守补丁,直接把顶级 Gemini Flash 从 50% 砸到了 18%, 你在低水平阶段摸索出的避坑套路,强行套给高手往往是一副要命的枷锁; 4️⃣ 开卷小抄练不出真本事: 实验证明,模型在实战练习时如果直接偷看全套知识库,最后进化出来的手册反而大退步, 因为靠小抄蒙混过关的过程,会把最致命的逻辑漏洞给彻底掩盖掉 别再把所有笔记和日志混在一堆乱炖了, 原始记录、提炼认知、可执行手册是三码事, 把失败变成资产,学习的飞轮才会真正转起来啊