DeepSeek V4 Pro定价仅海外竞品百分之一
各位好啊!我们一边热切等待新的 Qwen 3.8 模型,一边先为显存低于 16GB VRAM 的用户带来了新版本!现在 DeepSeek V4 Pro Qwen 9B 和 4B 已经正式发布了!
我们之前微调的 DeepSeek V4 flash preview 已经是我个人最喜欢的通用 9B 模型,而这一个版本在此基础上更进一步,完全基于 DeepSeek V4 Pro 的训练轨迹训练而成。
本次训练主要使用了数学和 STEM 样本,但在我和 Jackrong 的测试中,来自更大模型轨迹的 CoT 改动带来了整体实用性的提升!这也是我们第一次发布使用了 GSPO RL 细化步骤的模型!
我还靠这个模型在 Claude Code 里完整开发调试出了一款独特的游戏,名叫「Starskip」,Hugging Face Space 链接放在下面了。编码的迭代速度真的太棒了。
我用开启了 MTP 的 5090 测试,Q4_K_M 量化下代码生成稳定在 240tps,Q8 量化下是 220tps。还有大量剩余显存可以容纳扩展上下文。它清理数据集也非常强!它对指令和结构化输出请求的执行效果好得惊人!
请继续关注我们接下来的工作,我非常希望 @Alibaba_Qwen 团队能考虑再发布一个 9B 基座模型,因为它对消费级硬件来说有着绝佳的性能尺寸比!
欢迎在评论区告诉我们你在用它做什么,以及你有任何反馈都可以提!我很乐意和大家交流!祝各位本周一切顺利!开源之路才刚刚开始😎
新的 Qwen 3.8 基座马上就要来了,我们已经兴奋到不行!
DeepSeek v4 pro 性能泄露,和 Fable5 一样牛逼,仅落后 0.003!
一、极致的技术壁垒: 公司自研MLA、MoE、FP8三大底层创新,训推成本仅海外头部模型1/30,V3训练仅557.6万美元,大幅缓解芯片管制压力; V4-Pro性能跻身全球第一梯队,编程能力仅弱于Claude旗舰0.3%,百万token超长上下文,API定价仅海外竞品1/10~1/100,性价比断层领先;原生适配华为昇腾950PR,是国内三大自主“模型+芯片”路线核心,实现国产算力闭环。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖