测试者一周体验Gemini 4 Argon:模型强,但产品不行
一周前,测试者Inmerson获得了Gemini 4 Argon的提前访问权限,一周后访问结束。他在这一周内,从长对话、教育、编码、工具调用以及实际工作流等多个方面对模型进行了测试,以下是他的测试结果。
首先,Gemini 4 Argon和普通Gemini应用是完全不同的两类产品。在体验中,Argon给测试者留下了很深的印象,它完全不同于谷歌之前推出的旧版Gemini模型,整体风格、推理方式、幽默感和行为模式都比预期更有特点。
旧版Gemini模型的一个常见问题是急于完成任务,经常走捷径,只想着尽快结束任务,而非认真完成任务。而在多次测试中,Argon会主动补充测试者没有要求的细节,不会急于结束任务,反而会努力生成更好的结果,还能主动提出有创意、符合上下文的详细建议。
测试者特意测试了Argon的长上下文可靠性——这是旧版谷歌模型的常见弱点。他在同一对话窗口持续聊天7天,对话变得非常长,还要求模型在对话中一直使用编号结构,方便测试者跟踪连贯性。
在测试接近尾声时,测试者询问对话开头的细节,模型正确回忆了起来,更重要的是,测试开始时给出的规则,7天后模型依然遵守。这不代表幻觉问题已经完全解决,但测试结果显示谷歌确实在长上下文留存、指令遵循和一致性方面做了重大改进。
教育领域是Argon的另一个亮点。通过NotebookLM MCP,测试者给Argon开放了大量学术材料,包括笔记、视频和其他课程资源,模型可以快速分析这些材料,将其整理为学习计划、学习模拟和结构化的学习工作流,测试者认为这类模型对学生会非常有价值。
接下来是不好的部分:测试者的不满大多不是针对Argon模型本身,而是针对Gemini产品本身。Gemini网页端应用设计不错,但功能上在很多关键领域都落后于ChatGPT这类产品。
现在的AI产品早已不只是聊天机器人,问题不只是模型有多聪明,而是产品从始至终到底能为用户完成什么事。在ChatGPT中,用户可以提出一个正式的编码项目需求,最终得到结构化的项目文件,甚至可以要求生成一个安卓应用,得到可下载安装的安装包(APK),也能将代码打包为ZIP文件,这种体验从“告诉我怎么做”变成了“帮我建好把结果给我”。
Gemini在这类端到端工作流上还不够成熟。如果用户还是得回到ChatGPT去生成、打包和交付实际项目输出,那Argon的能力就会被配套应用限制住。
插件和工具是另一个主要弱点。Gemini有不错的想法,包括自定义插件和Skills功能,但实际使用体验还存在很多问题。测试中,频繁请求权限、工具流程不一致,也没有预期中的“始终允许”选项。这些看起来是小的用户体验细节,但很快会让用户疲惫。
即便是谷歌自家的云端硬盘(Drive)集成,也达不到预期的能力和可靠性。测试者要求Gemini编辑电子表格时遇到了问题,问题出在工具层而非模型层。这点很难让人接受,毕竟整个生态都是谷歌自己的,如果第三方AI产品对接谷歌服务都比谷歌自家AI应用更顺畅,那集成层就需要认真改进了。
不过新的Skills系统确实不错,直接在聊天中创建或关联技能的体验很自然,基于上下文自动选择技能是测试者很喜欢的一点。但在深度自定义技能、更丰富的引用和更广泛的工具工作流方面,ChatGPT还是更成熟。
使用限制也需要调整。在提前体验阶段,大约只有5小时的使用窗口,同时Gemini提供的端到端功能还比竞品少,这种平衡很难让人接受。相比之下,日常使用ChatGPT在基础聊天中限制更少,同时还能处理更大型的项目和文件工作流,谷歌需要重新思考这种价值配比。
后台运行也是必须修复的问题。如果用户发起一个长时间任务,关闭应用、锁屏或者切换设备不应该终止任务,任务应该在谷歌服务器上继续运行,等用户回来的时候已经处理完成。ChatGPT和Claude早已实现了这种体验,2026年,一个合格的AI产品不应该要求用户一直开着对应页面等任务完成。
测试者认为谷歌还需要更快推出产品改进。一些纸面看起来很小的功能改动,可以完全改变日常使用体验。竞品迭代速度很快,在AI领域,几个月的延迟影响很大。
如果测试者是Gemini产品团队的一员,他会不断研究ChatGPT和Claude,不是盲目抄袭,而是搞清楚什么样的产品决策能让它们日常使用更方便。
目前AI领域对Gemini已经有很多质疑,谷歌可以推出速度很快、成本很低或者能力很强的模型,但如果配套产品持续给用户制造 friction,很多用户还是不会把它当成主要使用的AI工具。
谷歌最大的挑战在这里:不是模型质量,而是产品落地。用户不活在测试基准里,他们活在应用里。
Gemini 4 Argon让测试者相信,谷歌有能力造出世界上最好的模型之一,但一个好模型和一个好AI产品不是一回事。
最让测试者印象深刻的不只是单纯的智能,而是Argon运用智能的方式:关注细节、长上下文一致、遵循指令、主动提出想法、明确倾向于改进结果而非简单结束任务。
基于7天的个人使用,测试者不会称它为通用人工智能(AGI),这个说法太夸张了,但可以说,Argon和他之前用过的模型确实有明显不同。
一周体验后的最终看法:谷歌可能能赢下模型竞赛,但如果Gemini应用不以同样快的速度进化,它可能还是会输掉用户竞争。最后,测试者感谢谷歌提供Argon的提前访问机会,他很珍惜这次机会。