两款开源大模型同台比拼开发章鱼入侵游戏
博主放出了两款开源大模型开发游戏的完整对比录像。两款都可容纳在单块DGX Spark显卡中,使用完全相同的157行《章鱼入侵者》游戏开发提示词,以及同一个Hermes代理框架,博主完整记录了两款模型的全部开发过程。本次对比是Local Arena系列的第四期内容。
来自@AntLingAGI的Ling 3.0 Flash以工匠般的精度完成开发,最终生成了2366行JavaScript代码,完全遵循提示词的要求实现了全部功能,共有4种章鱼、像素网格渲染、BOSS人工智能、伤害浮动数字、屏幕震动,成品完成度很高,全部18项测试都通过。
精度带来了速度代价,它的解码起始速度为每秒39.5个token,随着代码量增加逐渐下降,代码量达到2.4万行时降至每秒12.9个token,5.1万行时每秒7.0个token,10.7万行时只剩每秒3.7个token。完整开发耗时两个夜晚,过程中服务器崩溃了8次。
来自@poolsideAI的Laguna S 2.1开发节奏稳定,相同需求下生成了1888行代码,比前者精简了20%,全部开发仅用约50分钟的服务时间。它的解码速度始终稳定,不同代码量下都维持在每秒约19个token,流畅运行干净代码时峰值能超过每秒50个token。
测试过程中两款模型都导致DGX Spark崩溃,这属于服务框架问题而非模型本身问题,重启后两款都能从断点继续开发,其中Laguna甚至无需重新提示,就能自主恢复中断的会话继续按原计划开发。
本次比拼是「耗时换精度」和「匀速保完整」的对比,所有测试数据、成品游戏和对比录像都已经公开。博主放出了Ling完整开发的长录像,包含崩溃恢复过程和最终成品运行画面;放出了Laguna从空目录到成品的完整50分钟开发录像;所有测试所需的提示词、运行配置都已公开,任何人都可以自行重复测试。