AI Pulse
📡 X 信号

2.8万亿参数Kimi K3发布 开发者对比测试9款前沿模型

Kimi K3 发布,参数规模 2.8 万亿。我在自己开发的开源 AI 测试框架中,让它和 9 个前沿模型同台比拼:Claude Opus 4.8、Fable 5、Grok 4.5、Gemini 3.1、GPT 5.3。

全新的@Kimi_Moonshot 模型有一个设计巧思:总共 896 个专家,每个 token 仅激活 16 个专家;Delta Attention 是线性复杂度,而非 n 平方复杂度;循环可以复用上一轮迭代的 token 💻

给仓库点星:🚀 Kimi K3 文档:所有模型都在同一个框架中运行:代理循环 → 记忆检索门限 → 工具调用 → 评估 → 追踪,还附带实时成本面板。

GPT 5.6 Sol 不允许我在我的框架中调用工具,因此它无法参赛,转而担任了评委。

一共 8 场比拼:日历工具、网页搜索、子代理、贪吃蛇游戏。最终的排行榜真的出乎我意料,成本表更是让我惊讶。

视频前 8 分钟:讲解这个模型的工作原理。剩下的内容:比拼过程。先看视频,再保存下方的白板笔记。🔖 你可以打造任何东西。你可以学会任何东西。💪

0:00 Kimi K3 登场:2.8T 参数,1M 上下文
1:47 这个模型的本质是什么
2:30 MoE:896 个专家,仅激活 16 个
5:28 Kimi Delta Attention:运行平均,而非 n 平方
7:28 为循环设计:为什么代理开发者应该关注
8:00 测试:waku-agent 快速入门
8:41 测试:对比标签页,10 个模型,1 个评委
10:27 比拼 1:法国首都 + 成本面板
13:10 比拼 2:预约咖啡(日历工具)
14:20 比拼 3:组建宝可梦队伍
15:07 比拼 4:网页搜索 + 起草消息
16:18 比拼 5:配合子代理玩贪吃蛇游戏
17:02 最终排行榜:8 场比拼,评分与成本
18:26 额外内容:语言模型极简史
19:27 最终总结 + 如何参与贡献

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部