测试者推翻此前对Mistral大模型的负面评价
测试者superalesha公开承认自己此前错看了Mistral大模型。他第一次测试Mistral Large 4 FPS时,关闭了模型的推理功能。
他此前曾承诺,如果开启推理后模型表现变好,就收回之前的评价。因此他在模型支持的最高推理设置HIGH下重新运行了相同提示词,本次测试共生成15.1202万个推理token,花费1.97美元。
重测结果确实显示模型表现更好,但superalesha仍表示该模型体验不好,具体内容可查看相关视频,他笑称自己做了个愚蠢的承诺。
不少人可能会认为,Mistral本就不是面向这类娱乐场景打造,它的定位是专业软件开发、商业应用、网络安全等严肃领域,superalesha认为这种说法很可能是对的。
他也承认,欧洲拥有自己的大模型本身就是一件很棒的事,他无意抹黑或诋毁Mistral的开发团队,这些开发者毫无疑问都是高技能的专业人才。但他仍希望看到能处理各类任务的通用大模型,不需要样样完美,但需要朝这个方向努力。
他提到,通义千问(Qwen)就是理想的例子,Qwen3.8 27B彻底改变了他对本地大模型能力的认知,Qwen3.8 Flash Next更是让他感到惊讶,他希望未来能出现更多能激发用户尝试新玩法的大模型。