AI Pulse

GLM-5.2与Grok-4.6AI成本测试,结果打破预算分配认知

GLM-5.2与Grok-4.6AI成本测试,结果打破预算分配认知

我们对开启最大深度推理(thinking=max)的GLM-5.2和开启低深度推理(thinking=low)的Grok-4.6,完成了逻辑推理、编码、写作三类相同基准测试。测试没有使用厂商营销数据,用真实token统计、真实成本和真实代码得到结果,打破了我们原本对AI预算分配方向的假设。

有人建议我们尝试低推理设置的Grok-4.6,称它可能比我们默认使用的最大推理GLM-5.2性能更好,成本更低。我们开展了这次测试,我们与两个厂商都没有利益相关,同时付费使用两款模型——通过Ollama云计划使用GLM-5.2,通过OpenRouter使用Grok-4.6,我们只想弄清楚哪个模型能实现单位美元更高产出,应该把计算资源预算投在哪里。

测试在OpenRouter API上完成,两个模型使用完全相同的提示词和参数。

第一个测试是狼羊卷心菜过河逻辑推理题,要求分步解答。GLM-5.2耗时12.6秒,总token1752个,推理token900个,成本0.004115美元;Grok-4.6耗时10.2秒,总token856个,推理token327个,成本0.003868美元。

两个模型都正确解出题目,GLM-5.2的解答更详细,对新手更友好;Grok-4.6更简洁,同样准确。两者成本只差约0.0003美元,差异极小,本次测试结果为平局。

第二个测试是编写Python最长回文子串函数,要求包含算法说明、时间复杂度和至少两个带断言的测试用例。GLM-5.2耗时13.1秒,总token1091个,推理token265个,成本0.001613美元;Grok-4.6耗时11.3秒,总token1041个,推理token452个,成本0.005086美元。

两个模型都采用扩展中心算法,时间复杂度O(n²),空间复杂度O(1),全部测试都通过。GLM-5.2的代码清晰、注释完整,覆盖5种边界测试用例,单独分析了复杂度;Grok-4.6的代码更紧凑,但索引计算晦涩,后续修改容易出bug,仅包含4个测试用例和一行复杂度注释。

本次测试GLM-5.2胜出,它的文档更完善、测试覆盖更全、代码可读性更高,成本仅为Grok-4.6的三分之一。

第三个测试是撰写150词的执行摘要,论证从第三方社交工具迁移到自托管方案,核心围绕成本、控制权和可靠性三个方向。GLM-5.2耗时13.2秒,总token2232个,推理token1850个,成本0.005305美元;Grok-4.6耗时12.4秒,总token824个,推理token390个,成本0.003736美元。

两个模型都满足字数要求,覆盖了全部三个核心方向。GLM-5.2风格更偏向企业正式表述,专业但有较多行业套话;Grok-4.6表述更直接具体,论点更清晰。GLM-5.2在千余字符的输出上,消耗的推理token比输出本身还多,属于过度思考。

本次测试Grok-4.6胜出,它的文字更凝练,表述更具体,没有浪费推理资源。

汇总三项测试结果,GLM-5.2总成本0.012625美元,总token5041个,总推理token3116个,总耗时33.6秒,总输出长度7734字符;Grok-4.6总成本0.011310美元,总token2491个,总推理token872个,总耗时31.5秒,总输出长度3615字符。

Grok-4.6总token减少53%,推理token减少72%,整体成本比GLM-5.2低约10%。但token效率除了单调用成本外,还会影响速率限制、吞吐量,以及固定时间内能完成的工作量。

我们通过Ollama云计划使用GLM-5.2,该计划是固定费率,每周有充足的使用额度,我们每天做大量AI工作,几个月来从来没有用完额度。2026年8月14日GLM-5.3已经发布,会在Ollama免费更新,不需要额外付费。

我们通过OpenRouter按token付费使用Grok,本次测试同一天,我们之前购买的xAI API额度就已经耗尽。按token付费的模式下,额度消耗完就必须再次购买,是持续的运营支出。

低推理设置的Grok-4.6是一款不错的模型,它输出紧凑,推理高效,适合单次、对输出简洁度有要求、不介意成本的任务。

但对每天都要运行AI代理,完成编码、调研、写作、流程编排的企业来说,性价比结论很清晰。性能足够、可用量无限制、还能免费升级的模型更合适,按token计费、半天就会耗尽额度的模型没有优势。

我们会继续把GLM-5.2计划作为主要计算资源,停止在Grok API上按token消费。等GLM-5.3上线Ollama后,我们会重新测试评估。

所有测试于2026年8月14日完成,token计数和成本来自OpenRouter API返回的使用元数据,代码在本地Python 3.12环境测试验证,完整结果保存在SMF Works。

阅读原文
📚 相关主题 大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新