AI Pulse
📡 X 信号

两款开源大模型在单DGX Spark上开发游戏对决 结果双双宕机

两款适配单块DGX Spark的主流开源大模型完成了AI对战测试。测试使用完全相同的157行Octopus Invaders游戏开发提示词,以及相同的Hermes代理框架,全程记录了两款模型的完整开发过程。本次对决是本地竞技场系列的第四场完整对头测试。

来自@AntLingAGI的Ling 3.0 Flash如同工匠按规范施工,最终生成2366行JavaScript代码,所有参数规格都严格按照提示词生成配置。成品包含四种章鱼类型、像素网格渲染、BOSS AI、伤害浮动显示和屏幕震动,体验上已经是完成度很高的成品,18项测试全部通过。

这份精准也付出了时间和速度的代价。Ling 3.0 Flash的解码速度从初始的每秒39.5个token开始,随着代码量增加逐渐下降,代码量2.4万时降到每秒12.9个token,5.1万时降到每秒7.0个token,10.7万时只剩每秒3.7个token。完整开发耗时两个晚上,过程中出现8次运行崩溃。

来自@poolsideai的Laguna S 2.1的开发风格更接近赶工的机器。同样的需求下,它生成了1888行代码,比前者少了20%,从空目录到生成可用完整文件只用了约50分钟的运行时间。

它的解码速度全程没有下滑,借助dflash,不同代码量下解码速度稳定在每秒19个token,清理代码运行时峰值能超过每秒50个token。

测试中两款模型都导致DGX Spark崩溃,问题出在GB10服务配置,和模型本身无关,且两款都能从磁盘断点恢复继续开发。Laguna甚至无需重新提示,就能自行恢复崩溃前的会话,继续按原有计划开发。

本次对决本质是「牺牲速度换精度」和「恒定速度保完整」的对比。测试组织者已经公开了所有测试数据、可运行的两款游戏成品和完整录像。

所有可自行复现本次对决的材料也全部公开,包括两款模型用到的157行提示词、Ling 3.0 Flash在单Spark上的完整服务配置,以及隔离存放的参考构建目录,避免AI提前获取答案,任何人都可以用自己的模型参与测试。

链接中分别提供了Ling完整开发录像(包含崩溃恢复流程、最终524915分运行记录)、Laguna完整开发录像,以及全部公开测试材料。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新