AI Pulse

AI 不再只是对手,DeepMind 要让它在游戏里当你的伙伴

AI 不再只是对手,DeepMind 要让它在游戏里当你的伙伴

谷歌DeepMind今年早些时候和Fenris Creations宣布了一项研究合作。对象是EVE Online、EVE Vanguard和EVE Frontier。目标不是让AI赢下游戏,而是让它当个能陪人的伙伴。

这个方向的主角是SIMA 2。它由Gemini驱动,能实时推理和对话。它通过屏幕看游戏,玩家看到什么,它就看见什么。它理解自然语言指令,用普通键盘和鼠标操作,不需要API,也不需要访问源代码。

这条路走了很久。最早的起点是DQN,一套用深度神经网络玩Atari 2600游戏的系统。它不需要针对单个游戏做工程调整,自己学会了49款游戏,Pong、Breakout、Space Invaders都在里面。2015年,Nature发表关于DQN的论文,把深度强化学习带进现代阶段。

2016年,AlphaGo击败世界冠军李世石。这个成绩,许多专家以为还要再等十年。比赛里的第37手相当出人意料,职业评论员一开始以为那是失误,后来它启发了新的围棋策略。AlphaGo Zero更彻底,完全靠自我对弈,不用任何人类数据,超过了之前所有版本。AlphaZero用一套算法同时掌握国际象棋、将棋和围棋。MuZero连规则都不看,也学会了游戏。2019年,AlphaStar在星际争霸II里达到大师级水平,处理的是实时复杂性和不完美信息。

这些里程碑有个共同点:AI会玩游戏,但不会陪人玩。SIMA 2要补的,正是这块。

选EVE,是因为它的环境够复杂。EVE Online 2003年上线,数千名玩家共享同一个宇宙,这个宇宙已经持续演化超过20年。经济由玩家驱动,供需关系是真的,贸易网络横跨数千个星系。这个环境给AI出了四道题。第一道是持续学习:世界一直在变,AI要学新本事,又不能忘掉旧本事。第二道是记忆:有些信息要存很久,远超当前模型能处理的上下文长度。第三道是长期规划:做决定要按周、按月,甚至按年。第四道是多智能体动态:合作、竞争、谈判、经济、自发社会行为,全挤在一起。

三款游戏各有用处。EVE Vanguard是第一人称,负责地面级的快速战术决策。EVE Frontier有可编程的“智能组件”和开放架构,世界规则本身可以改,AI必须不断适应新机制。

DeepMind把进入路线定得很清楚。先在EVE Online的离线实例里做沙盒,跟真人玩家隔开。再用EVE Frontier研究人类和代理怎么在持续开放的世界里共存。等能力成熟,才考虑进入EVE Online和EVE Vanguard,目的是丰富真人玩家的体验,不是替代他们。Aura Guidance已经落地,它用Gemini处理真实新手问答,给新飞行员提供参考。

如果通用游戏代理成熟起来,现有游戏不用改代码,就能加入AI能力:AI同伴能真正理解游戏世界,NPC会根据玩家行为灵活回应。开发阶段,游戏代码每次提交都在变,代理能承担稳健的QA测试。游戏上线后,遇到新内容或者玩家不按套路来,它也能实时适应,不需要重新写脚本。

合作工作室分布在好几个品类。Coffee Stain做过Valheim和Satisfactory,Hello Games做过No Man's Sky,Keen Software House做过Space Engineers,Strange Loop Games做过Eco,Foulball Hangover做过Hydroneer。Wobbly Life、Road 96、Teardown这些游戏的开发商也在名单里。

DeepMind创始人之一Demis Hassabis自己就是游戏开发者出身,团队里不少人有同样的背景。长线目标也不止于游戏:让游戏更容易上手、更个性化,再把从游戏学到的东西用到现实世界和科学发现。AlphaFold就是这么来的。游戏研究打下的底子,后来解决了蛋白质结构预测这个50年难题,2024年拿了诺贝尔化学奖。

AI能力何时进入商业游戏、在EVE玩家经济里又怎么和真人共存,都还没有时间表。

阅读原文
📚 相关主题 游戏研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新