AI Pulse

软件优化承诺AI推理提速30倍 现有GPU无需更换

软件优化承诺AI推理提速30倍 现有GPU无需更换

法国初创公司Kog想证明一件事:企业在用的数据中心GPU,性能还有不少余量。它做的事是软件优化,把传统GPU的推理速度再往上推。2025年5月,Kog带着技术预览登上Hacker News首页。演示在AMD MI300X和Nvidia H200上实现了极快的单请求解码,这两款都是企业已经拥有的标准数据中心GPU。

演示与线索

不是每个人都满意。有人失望,因为这个演示没有覆盖笔记本电脑里的GPU;另一些人看到了潜力。演示结束后,CEO兼唯一创始人Gaël Delalleau说,公司拿到了200个具体的商业线索。

速度值钱

Kog的卖点很直接:AI回复不用再等几小时,承诺是30倍提速。Anthropic自己也这么想,它的Claude Fast Mode收费是标准版的数倍。用Claude Code做开发的人也很清楚,有时为了一个结果要等几个小时。Kog想抓住这些因为延迟而流失的客户,他们通常依赖AI工作流完成专业任务。

根据早期反馈,Delalleau预计软件工程会是第一个使用场景。Kog还有一批设计合作伙伴。用户输入一句提示就能生成游戏和应用,Kog推理引擎跑得越快,这些合作方赚得越多。

承诺与现实

不过离30倍更快的LLM推理还有距离。演示中每秒3000个令牌的速度相当快。跑的是约20亿参数的Laneformer 2B,一个为演示专门准备、现已开源的小模型。

Kog在观察需求时发现,潜在客户并不打算微调小模型。发布之后,公司把所有精力转向加速更大的模型。Delalleau的日程表上,9月安排得很明确:先完成第一个主要模型10倍提速,再展示客户吸引力,随后启动A轮融资。这个目标能否兑现,直接检验软件优化对大模型是否有效。

从白帽黑客到GPU工程

Delalleau本人的背景解释了他为什么走这条路。他在法国综合理工学院学固体物理,之后做过进攻性网络安全,也就是白帽黑客。四次闯入DEFCON CTF锦标赛决赛的经历,让他习惯“在非常低的层面做逆向工程——一直到汇编语言和二进制代码,理解它如何工作,再尝试用它达成一个原本不是为它设计的目标”。现在他把这套方法用在GPU上。每遇到一款新GPU,Kog会投入几周甚至几个月,研究硬件细节。

代价也很清楚:团队只有11人,短期内能支持的芯片数量有限。Delalleau不认同“GPU不适合解码”的说法。在他看来,新GPU的内存带宽越来越充裕,只是还没被充分利用。Kog的长期计划,是把方法论接入基于智能体的管道,从而覆盖更多芯片和模型。

同行与后盾

法国同行ZML走了另一条路。它发布绕过Nvidia CUDA的硬件无关软件,支持在不同芯片上快速推理。Delalleau说,Kog更像斯坦福大学的Hazy Research实验室,只是把重点放在更底层的GPU加速上。

资源上,Kog已经得到Scaleway支持,以及法国Bpifrance和French Tech 2030项目的扶持。种子轮由Varsity VC共同主导。这家基金的合伙人Kamel Zeroual,是Delalleau第一家创业公司Stribe的联合创始人。Stribe是TechCrunch50 2009的成员,和现在的公司没有关系。

目前Kog没有公开软件优化支持哪些GPU,也没有拿出大模型上的实测数据。9月的10倍提速目标,会是第一个验证节点。

阅读原文
📚 相关主题 GPU创业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新