AI Pulse
📡 X 信号

AI芯片现在最大瓶颈不是算力是数据搬运

AI芯片现在最大瓶颈不是算力是数据搬运

科普长文:各家AI芯片的架构 梳理了每家AI芯片的架构和发展历史,内容非常详实。简单总结: 大模型本质上就是在疯狂做矩阵乘法。但现在算力增长太快,内存传输数据的速度跟不上了,数据搬运成了最大的瓶颈。

为了解决这个问题,几家大厂给出了完全不同的解决思路: NVIDIA GPU:老大哥走的是全能路线。芯片上有成千上万个小核心并发干活,硬件和 CUDA 软件生态高度绑定。虽然芯片设计很复杂,但通用性极强,不仅能训练大模型,还能用来渲染图形、做科学计算。

Google TPU:Google 专为矩阵计算定制了脉动阵列。它不搞复杂的硬件调度,全靠自家的 XLA 编译器提前规划好每一步。硬件结构精简很多,能省下大量功耗去堆算力,专门服务 Google 自家的大模型和业务。

AMD GPU:AMD 的核心逻辑是堆大显存和走开源路线。芯片计算单元设计相对保守,但在显存容量上非常大方,能直接在单台机器里塞下更大的模型,同时联合行业力量推开放标准来抗衡 NVIDIA。Cerebras WSE:想法最激进的一家。

别家都是把整块晶圆切成几百颗小芯片,Cerebras 直接不切了,做出一整块像餐盘那么大的巨型芯片。数据全在片上高速传输,生成文字的速度极快,但造价昂贵、功耗极高。AWS Trainium:亚马逊走高性价比的云端定制路线。

它借鉴了 Google 的脉动阵列和编译器思路,重点打磨网络互联,把通信模块做进硬件里,目标就是让开发者在 AWS 云上以更低的成本跑模型。Groq LPU:追求极致的确定性。它去掉了传统芯片里所有不确定的缓存和预测机制,完全由编译器按时钟周期精准安排任务。

文字输出延迟极低,但单颗芯片容量很小,跑大模型得拼上几百颗。博客全文:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新