AI Pulse

开源多模态模型能同时看懂文字图片视频 处理百万token

开源多模态模型能同时看懂文字图片视频 处理百万token

一个眼睛和大脑长在一起的模型

Kimi K3是月之暗面发布的开源权重原生多模态模型,总参数量2.8T,每次推理只激活104B参数。它的核心能力很特别:文字、图片、视频都在同一个模型里处理,不需要先转文字再拼接。你给它一部电影,它可以直接看懂画面和字幕;给它一本300页的书,它能一次性读完并理解上下文——它的上下文窗口是100万token。

视觉编码器叫MoonViT-V2,有4.01亿参数,负责把图像和视频画面转换成模型能理解的信息。

能做的事不在聊天框里

Kimi K3从一开始就面向“干活”设计,不是单纯的对话模型。它在长程编码任务上表现突出:GPU内核优化、编译器开发、游戏开发、CAD、芯片设计——这些都需要长时间保持上下文连贯。它还能自主完成智能体知识工作,比如生成一份深度研究报告,里面带有交互式图表、仪表盘,甚至能做动态设计和视频编辑。

月之暗面推荐把Kimi K3和Kimi Code CLI配合使用,作为它的智能体框架。它能直接在命令行里写代码、运行、调试,而不只是给出代码片段。

与顶级闭源模型掰手腕

月之暗面公布了Kimi K3在多个评测集上的成绩。在GPQA Diamond上得分93.5,在DeepSWE上得分67.5,在BrowseComp上得分91.2。这些数字放在与Claude Fable 5和GPT-5.6 Sol的对比里,部分指标领先。

在需要跨应用操作的OSWorld-Verified上得分84.8,在工具调用能力测试MCPMark-Verified上得分94.5。最难的视觉推理测试ZeroBench(pass@5)上得分23.0/41.0,也超过了同场竞争的模型。

开源且便宜,开发者已能上手

Kimi K3的完整模型权重以开源形式发布,许可证是Kimi K3 License。这是世界上第一个开源的3T级模型。月之暗面还做了量化:训练阶段就引入了量化感知,最终权重用MXFP4、激活用MXFP8,这使得部署成本和推理延迟都低于未量化的同等模型。

Kimi K3的API已开放,地址是platform.kimi.ai,同时兼容OpenAI和Anthropic的API格式。开发者不需要额外适配,直接替换接口名就能调用。月之暗面推荐在vLLM、SGLang和TokenSpeed三个推理引擎上运行。

始终在思考的透明模型

Kimi K3有一个独特设置:每次回答都会返回完整的推理过程(reasoning_content),并且支持设置思考努力程度(reasoning_effort参数,可选low/high/max)。在多轮对话和工具调用时,它要求用户把完整的assistant消息包括推理过程和调用记录传回,这样下一轮才能准确延续上下文。

Kimi K3的词汇表大小160K,共93层,注意力隐藏维度7168,注意力头数96。这些数字决定了模型能表达的信息精细程度。

Kimi K3是第一个开源的3T级模型,权重和量化方案都已公开,开发者可以自由使用。

阅读原文
📚 相关主题 开源大模型

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部