哈佛和MIT研究者做了个AI模拟,装了83亿虚拟人
没人能创造《黑客帝国》里的矩阵。不过,实际上……他们现在真的造出来了。
哈佛和MIT的研究人员刚刚搭建了一个包含83亿虚拟人口的AI模拟系统,数量大致相当于地球总人口。他们把它命名为MatrAIx。
这是一个人口规模的模拟基础设施,由GPT和Claude这类大厂模型驱动。它的核心是一份细节惊人的数据集,名叫Persona 8B。数据集包含83亿份数字档案,每个人物都由1290个分类维度刻画。
这些维度包括:背景、心理、消费习惯、行为特质、技术素养、生活方式。但他们不只是建了一个庞大的统计数据库,还把这些人物做活了。
研究人员把这些人物智能体放到四种不同的数字环境中:
• 问卷调研
• AI聊天界面
• 实时网页浏览
• 原生应用
接着他们测试了这个模拟人口对产品、软件和用户体验变更会作何反应。这套系统能够捕捉到提价后的犹豫、AI助手故障后用户继续使用的意愿,以及对延迟的容忍度这类反应。
当研究人员测试智能体是否真的按照分配给它们的人物设定行事时,他们报告称,在400次对照试验中,符合度达到了91.5%。
这听起来对测试来说太完美了。但背后藏着一个巨大的问题。
人类并不总会按照自己的档案行事。我们是飘忽不定的。理性的买家偶尔也会做出不理性的购买行为。讨厌等待的人可能会莫名其妙地容忍一次糟糕的体验。本该放弃结账的人可能还是会坚持付完款。而且有时候,这些行为根本找不到明显的原因。
所以如果我们要模拟人类,我们还必须模拟人类的不可预测性。只让AI人物的行为和它的人口统计特征、心理和历史偏好保持一致是不够的。它总得有一定概率做出完全出人意料的事。
而这点非常难建模,因为你实际上并不知道人类在任意给定情景下做出反常行为的概率是多少。这最终可能会成为人口模拟最大的挑战之一。
因为这类系统越接近模拟数十亿人,它们在产品、定价和用户体验投放到真实世界之前就越有用。想象一下,一夜之间就能让数百万模拟用户测试一款产品,而不用等传统市场调研花几周时间。
但这里有一个重要的区别:模拟83亿个人物,不等于预测83亿个真实人类。而最后那部分,可能恰恰是最难复制的——混沌。
有趣的是,这恰恰就是真实人类行为数据会越来越值钱的原因。模拟可以建模出人类应该做什么。真实互动数据才能揭示人类实际做了什么,包括停顿、错误、奇怪的决策和模型永远想不到要自己生成的意外路径。
这个区别和Action Model从真实人机交互中学习的方法高度相关。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖