AI Pulse

DeepSeek-V4.1-Flash上传至Hugging Face,网友热议性能改进

―― 高票评论(帖子共285条讨论)――

[+482] u/Top_Power5877:KV缓存压缩改进惊人。现在1M上下文仅约900MB 🤯

https://preview.redd.it/841ly1yzwmoh1.png?width=1080&format=png&auto=webp&s=f72b3a2cb311b5f82009982298e17702cab5bcaa

[+149] u/Top_Power5877:基准测试表现不错!在通用知识方面略低于前沿水平,但在代理编码方面几乎与sol和opus持平。

https://preview.redd.it/f63eq9fgxmoh1.png?width=1080&format=png&auto=webp&s=1c2a5c33b02f85da1206b8f4b7390434ea7aebdb

[+143] u/rerri:552B MoE LLM + 196B Engram。

解码时激活16B参数,预填充时激活8B参数。

QAT KV缓存,FP4

很酷的东西,可惜对我的128GB内存来说太大了 :/

[+106] u/TheFunSlayingKing:它变大了……这有道理,但对我来说没那么令人兴奋了

不过,还是谢谢蓝鲸

[+38] u/ihatebeinganonymous:所以他们转向了fp8,开始使用N-gram,并增加了参数数量。

也许这不该再叫“Flash”了?(我不是负面意思,只是从实际角度说,因为变化太多了)

[+42] u/Confident_Ideal_5385:这不是一个.1版本发布。

- 编码器/解码器架构
- 不同尺寸,新预训练?
- 他们对聊天格式做的那些改动,用Python和Rust实现但没用jinja2

可能要等一段时间才能看到llama支持这个东西。

[+24] u/t4a8945:谢谢DeepSeek!

[+20] u/Treidge:确实看起来ngram权重大约有204 GB,实际模型文件是8位(不像DSv4-Flash发布时是4位)。所以,8位的306 GB在4位下大概会落在155-160 GB左右,就像DSv4-Flash一样。

对我来说似乎是赢了!👍 相同的“激活”模型大小,加上可以从SSD访问的ngram扩展能力。

[+18] u/chensium:510GB :(

[+19] u/Altruistic_Heat_9531:https://preview.redd.it/jrpi3osezmoh1.png?width=1417&format=png&auto=webp&s=aed6df521937297f2f8aaecbae1db7bd757ce080

好吧,我们又回到了“T5”编码器-解码器时代

[+18] u/mr_zerolith:485b参数……所以你真的需要256GB显存才能运行一个中等大小的Q4

“engram n-gram查找”?希望这意味着部分模型可以放在磁盘上……

[+10] u/Professional-Bear857:看安全张量文件,似乎最后两个是ngram权重,占总大小超过200GB,所以希望这些可以从SSD访问。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新