DeepSeek-V4.1-Flash上传至Hugging Face,网友热议性能改进
―― 高票评论(帖子共285条讨论)――
[+482] u/Top_Power5877:KV缓存压缩改进惊人。现在1M上下文仅约900MB 🤯
[+149] u/Top_Power5877:基准测试表现不错!在通用知识方面略低于前沿水平,但在代理编码方面几乎与sol和opus持平。
[+143] u/rerri:552B MoE LLM + 196B Engram。
解码时激活16B参数,预填充时激活8B参数。
QAT KV缓存,FP4
很酷的东西,可惜对我的128GB内存来说太大了 :/
[+106] u/TheFunSlayingKing:它变大了……这有道理,但对我来说没那么令人兴奋了
不过,还是谢谢蓝鲸
[+38] u/ihatebeinganonymous:所以他们转向了fp8,开始使用N-gram,并增加了参数数量。
也许这不该再叫“Flash”了?(我不是负面意思,只是从实际角度说,因为变化太多了)
[+42] u/Confident_Ideal_5385:这不是一个.1版本发布。
- 编码器/解码器架构
- 不同尺寸,新预训练?
- 他们对聊天格式做的那些改动,用Python和Rust实现但没用jinja2
可能要等一段时间才能看到llama支持这个东西。
[+24] u/t4a8945:谢谢DeepSeek!
[+20] u/Treidge:确实看起来ngram权重大约有204 GB,实际模型文件是8位(不像DSv4-Flash发布时是4位)。所以,8位的306 GB在4位下大概会落在155-160 GB左右,就像DSv4-Flash一样。
对我来说似乎是赢了!👍 相同的“激活”模型大小,加上可以从SSD访问的ngram扩展能力。
[+18] u/chensium:510GB :(
[+19] u/Altruistic_Heat_9531:https://preview.redd.it/jrpi3osezmoh1.png?width=1417&format=png&auto=webp&s=aed6df521937297f2f8aaecbae1db7bd757ce080
好吧,我们又回到了“T5”编码器-解码器时代
[+18] u/mr_zerolith:485b参数……所以你真的需要256GB显存才能运行一个中等大小的Q4
“engram n-gram查找”?希望这意味着部分模型可以放在磁盘上……
[+10] u/Professional-Bear857:看安全张量文件,似乎最后两个是ngram权重,占总大小超过200GB,所以希望这些可以从SSD访问。