AI Pulse
📡 X 信号

DeepSeek发布DeepSeek-V4-Pro-0813 大模型(4096)

DeepSeek发布DeepSeek-V4-Pro-0813 大模型(4096)

突发:DeepSeek-V4-Pro-0813还真是发错了模型啊😅 昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题: 开源版本的模型架构,居然完整对上了之前的 V4 Flash,而不是 V4-Pro- preview。具体是: hidden_size:4096 43 层 256 个 routed experts 64 attention heads 这些参数和 V4-Flash 基本一致。而正常的 V4 Pro 应该是: hidden_size:7168 61 层 384 个 routed experts 128 attention heads 更蹊跷的是,问题被社区发现之后,Hugging face上的V4-Pro-0813 仓库一��被下架。

随后在北京时间的今天0点左右 DeepSeek 又重新上传了模型,把 config 改回了 Pro 的架构。事情到这里,本来还能解释成一句:开源的时候复制错 config.json 了。但后续有人继续检查 Hugging Face 的 commit history,发现重新上传之后,不只是 config 发生变化,部分 safetensors 权重文件的 SHA256 hash 和文件大小也变了。

也就是说,DeepSeek 很可能不只是改了一个配置文件,而是重新处理、导出甚至量化了一部分 checkpoint。这也让昨天 V4 Pro 0813 发布后出现的各种异常表现,变得更加值得重新审视。一个 1.6T 级别旗舰模型发布,最后可能栽在了一个错误的deployment上🤣。

模型炼得出来,发布没发明白。世界真的是一个大草台班子啊😉

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新