AI Pulse
📡 X 信号

@davis7实测ox alpha mystery模型表现

针对ox alpha mystery model的实际DeepSWE运行已经完成。最终准确率约为63%,而非我第一次子集测试得到的80%,这个结果合理得多。

我已经大量使用过这个模型,它确实是一个非常出色的模型。
- 比Claude或GPT拥有好得多的「语气一致性」
- 设计相当不错
- 能很好地处理子代理和漫长复杂的工作
- 代码质量不错,也能很好地理解我要求它做的事

我也遇到了一些奇怪的问题:
- 它有时候会留下无用的死代码,完全不像Sol这类模型做得那么彻底干净
- 尽管TPS表现不错,但这个模型用起来一点都不觉得快。尤其是在更高推理层级下,它要跑很久,效率感觉并不高。

这也可能只是因为我在cursor里运行它——我注意到模型在cursor里运行耗时都会更长,而且这里的平均token数表现其实还不错。它的水平大概在Sol medium档位,这个评价是合理的。

这个模型确实很不错。现在最大的问题是,GLM-5.x flash的传言是不是真的。如果它真的是一个可以在类似2x DGX sparks这样的设备上运行的小模型呢?那会是一个划时代的时刻,一件影响深远的大事。我非常兴奋能看到它正式发布。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新