IFM发布7B模型,性能追平27B通义千问
IFM刚放出了个神奇7B Dense小模型 K2-Horizon-7B. 神奇的是这玩意在AA Bench里面有21分, 而Qwen3.6-27B是22分, 也就是说这7B参数量快追平了27B的水平。甚至这个模型在诸如BrowseComp测试中碾压了前几代旗舰模型(GPT-5/DeepSeek-V4). 而且工程能力比如SWEBench Verified/ Terminal Bench 分数表现也很亮眼。所以敲打一波Qwen, 赶紧放出你们压箱底的Qwen3.8-35B-A3B, 别藏着掖着了。
要被偷家了!这个模型现在完全是社区明星了, 它的训练数据, 怎么训练的(recipe), 训练代码以及评估方法全都是开源的。参数上这个模型最大支持512K上下文, 但是注意, 这玩意虽然参数只有7B, 但是它是全注意力的, 所以上下文成本相当高。
目前还只有原始BF16精度, 如果要用128K上下文, 就要18G显存/统一内存。所以还是等等8bit/4bit量化版本比较好(我刚在X上 @ unsloth 了一波, 看看哥俩会不会有时间做量化吧) 以及这个模型同样支持设置思考强度。分为low/medium/high, 然后默认/官方强烈推荐用high. 如果现在不差显存想直接用可以使用vLLM/SGLang. 这俩已经支持了。
等 unsloth 放出量化版我给大家来一期10B以下小模型横评。MiniCPM5-2B 和其他几个小模型已经在跑了。#K2Horizon7B #MiniCPM52B #Qwen3835BA3B