Muse Code评测:模型表现不错,但配套产品拖后腿
VJNCapital一周就用完了Meta的Muse Code每周使用额度,他最意外的结论是,问题本身并不出在模型上,而是模型周边的产品体验。
Muse Spark 1.3 Max模型实际表现很好。它运行速度快,能很好遵循指令,处理了他测试的几乎所有任务,包括智能代理UI开发、API集成、数据库迁移、创意工作、可扩展性和效率重构,以及更复杂的逻辑开发,很少出现任务完全失败的情况。
但它在适配现有代码库模式方面,表现不如Claude和Codex。它虽然能正确解决任务,但有时候会引入新模式,而不是适配现有代码库的工作方式,带来不必要的后续工作。这个问题不一定是模型本身导致的,也可能是配套工具限制了模型能力。
使用额度方面,5小时的每周限额其实很宽松,可以同时运行多个代理数小时才会触达上限。这也是Muse对比Claude/Codex的一大优势。使用Claude/Codex时,用户总会担心额度不够,需要纠结要不要用高阶模型,要不要切换模型,而Muse用户可以放心直接用最高阶的Max模型处理所有任务,这才是订阅服务该有的体验。
命令行界面(CLI)是Muse Code的主要短板。CLI操作笨拙,很大程度限制了模型发挥作用。会话管理很差,运行多个代理需要同时打开多个终端,没有好的命名或分组功能,切换并行任务很麻烦,还有奇怪的自动滚动问题。
模型运算时会随机出现卡顿,需要刷新会话才能恢复,还会随机触发限流重试。它也没有合适的压缩式项目/对话记忆,无法让Muse跨会话理解整个代码库,这是最大的问题。Claude/Codex能持续理解整个项目,而Muse就像是一个能力很强但每次会话都会失忆的工程师。
语音体验也需要改进。目前Muse只支持第三方工具加复制粘贴,无法做到录音转文字生成提示词,Codex在这方面已经做得很好。用户也看不到直观的使用统计,比如上下文用量、5小时额度使用量和每周用量,这些都应该放在界面面板里。
性价比方面,Muse的定价很有优势,每月15美元就能使用前沿模型,是体验过的性价比最高的编程订阅服务。不过用完一周额度后发现,价格不是用户为Claude/Codex付费的主要原因,用户付费买的是完整服务包,包括模型、配套工具、项目上下文、会话管理、语音体验和可靠性。目前来看,还是愿意花更多钱用Claude/Codex。
现在会不会用Muse替换Claude/Codex?还不会。但模型本身其实不需要太多改进,下次迭代肯定会更好,Muse Spark已经足够有竞争力,差的只是Muse Code整体。如果能做好桌面应用、带分组命名的会话、并行代理快捷切换、持久压缩项目记忆、更可靠的会话、合格的录音转文字、使用统计、输出设置等,这款产品就能真正获得成功。
目前来看,潜力被命令行界面限制了,很难绕开这些问题继续使用。在改进之前,应该会停掉Muse Code订阅。如果能把Muse订阅整合到Codex里才是真的完美。