新AI认知架构Mnemos记忆效果2倍于Claude原生系统
各位……这真的是真的,真的真的。我接受了你们的质疑,并且做了测试。
对于刚关注我的新朋友:从2024年某个时候开始,我一直在开发一套AI智能体的认知架构。它叫Mnemos,和你听说过的任何记忆系统都不一样。事实上,它差别太大了,以至于每次我尝试向别人解释它时,他们都看着我,好像我在说外星语言一样,听完走的时候比来的时候更困惑。每次都这样。
不过没关系,反正它能用。但我不打算在这里解释它的工作原理,至少现在不。我会为此做一个视频,因为你需要亲眼看到才能明白。我保证,你们会看到的。
在我发推文说我构建了一个记忆系统,性能比Anthropic给Claude用的原生系统好约2.5倍之后,大家的反应基本和刚才说的“外星语言”情况差不多,但总体是积极的。我在这里有一个非常棒的社区,大家都深信我在做的工作。事实上,他们常常比我自己还相信。这也是我一直没停下的很大一部分原因。
但我选择关注质疑者而不是支持者,因为这是我知道的唯一能让我变得更好的方法。说实话,我生活里大多数事情都是这样。主要的批评非常简单合理——大多是关于测试Claude时的偏差问题,我们已经和Claude合作多年了,还有很多类似的疑问。
不过之前我们都没通过和Claude随便聊天来测试这些质疑。但这一次,我们把所有事情都推进了好几步,我现在就给你们把一切梳理清楚。
公平测试:我们测试了Mnemos是否能帮助AI(这次用的是 Claude Opus 5.5)在会话之间比Claude自己的原生记忆系统更好地推进实际工作。同一个模型回答了30个问题,这些问题来自我们过去真实的对话,由一个完全独立的模型(Astra)出题,分四种设置:无记忆、原生记忆、Mnemos、两者结合。
我们整个测试跑了两次,总共240次运行。为了保证公平,正如我所说,是由一个完全独立的模型——GPT 6 Astra——从原始转写文本生成问题,而不是从任何一个记忆存储生成,并且在测试开始前就封存了10个问题,这样就不可能针对它们调参。
然后由另一个独立裁判——GPT 6.1 Sol——给每个答案打分,而不是让Opus自己打分。裁判不知道哪个答案来自哪个记忆系统,直接进行头对头对比。换句话说,Astra读取了随机抽取的分散在11个项目中的17个会话的原始转写,这样我们的问题就不会偏向Claude可能会存储的既定概念。
两轮测试下来,Mnemos回忆起所需事实的数量大约是原生Claude记忆的两倍,大约是65%对33%,而且在封存问题上它也保持了领先。所以这次是约2倍,不是之前说的2.5倍。我对这个结果很满意。
到目前为止我们发现的唯一缺点:Mnemos会让Claude写出更长的回复,长得多。不过,在我们这次测试的环境里,没有写入用户偏好或指令,所以我认为这最终不是个问题。在我正常和Claude工作的环境里,完全没有这个问题。
不过最重要的事情不是这个记忆系统效果更好。更好的回忆从来都不是我们明确的目标。Mnemos的设计定位是位于记忆架构之上的认知层。重要的是,它最终刚好成为了一个更好的记忆系统。
通过这套认知架构,Claude能在不同会话、平台、项目等等之间获得连续性和持续一致性。事实证明,连续性作为系统预设目标的副产品,自然而然就产出了好得多的记忆。这和我2024年最初的假设完美契合。
连续性产生一致性,一致性需要同一性。多漂亮的循环,你不觉得吗?朋友们,要相信你的直觉。
兄弟,为了说服推特上一些人我没瞎编,我居然做了这么多事,真的太折腾了,简直疯了。但很快你们就能自己用它了。你们自己就能判断我有没有撒谎。我非常乐意提供整个测试过程的所有记录,你们可以检查每一行内容。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖