AI Pulse

七百行C代码让普通CPU跑现代AI模型

Ryan Senn把gemma4.c发在了GitHub上。用700行C代码,实现了一个现代LLM的完整推理。模型是Google的Gemma 4 E2B,最新的开放模型之一。下载模型、编译这一个C文件,普通CPU就能生成文本。不需要GPU,一台普通桌面机就够。

运行时自己处理tokenizer、transformer、KV cache、采样,还有CPU内核。底下没有推理框架,也没有外部库。权重和激活值用int8精度,支持OpenMP、AVX2和AVX-512 VNNI指令。

作者说,他做这个项目是为了看LLM推理在代码里的真实样子,不想停留在图表和公式上。从main()进去,能跟着一个prompt看完整段运行。缓冲区怎么分配、激活值怎么被数学运算改变、输入怎么变成新token,全都看得见。

性能数据来自作者自己的机器。在Ryzen 7 7700上,512-token预填充约639 token/秒,生成约25.9 token/秒。他的结论:比llama.cpp快。但快慢只在那一台机器上验证过,换别的CPU,结果如何还没有数据。

评论区已经有人想好了用途。有评论者说,标题叫'llm runtime“或”inference engine'更合适。另一位打算把它用作纯CPU语音助手的推理部分,周末测一下延迟。视频下面有人问是不是实时播放,随后在帖子里看到了作者的CPU型号。

仓库刻意保持小,只支持这一个模型和CPU推理。扩展其他模型的计划、GPU加速,页面都没提。长文本下的稳定性如何,同样没有数据。

阅读原文
📚 相关主题 大语言模型开源AI推理

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新