1小时入门AI推理:分享入门Day0学习路径
我知道很多人想转 AI Inference, 但 Day0 怎么开始呢?我在团队内整理了一个 1 小时的学习路径,分享出来,作为 Day0 的阅读和“开智”使用 大家可以通勤路上、上厕所、吃饭的时候,扫上两眼。收藏下来,慢慢品,都是干货请放心使用,希望对你有帮助。
这个学习路径是:AI 模型如何生成 → 哪些计算存储资源可以复用 → GPU 为什么忙不过来 → 高并发请求如何共享资源 → 怎样判断 AI 模型推理用户体验 1. 先理解模型生成和 KV cache|20 分钟 带着一个问题读:模型权重、KV cache、生成的文本,分别是什么东西?这是后面理解长上下文显存占用、缓存收益的基础 2. 理解 GPU 的两类���要瓶颈|15 分钟 看 GPU Architecture Fundamentals 的结构图,重点读 Understanding Performance 带着一个问题读:为什么换算力更强的卡,AI生成速度不一定按比例变快?文档里的 GPU 示例比较早,今天学习原理即可 3. 理解不同请求之间怎样复用缓存|10 分钟 读开头、Example workloads、Limits 第一篇讲生成过程中复用旧 K/V;这一篇讲不同请求共享相同前缀时,怎样进一步复用计算 它直接节省的主要是输入处理,也就是 prefill;新答案仍然需要逐步生成。
带着一个问题读:为什么缓存命中率很高,用户仍可能觉得慢?4. 理解长短请求如何争用同一张 GPU|20 分钟 读 Preemption、Chunked Prefill、Performance Tuning with Chunked Prefill 到这里,你就开始把已有的资源调度、容量和延迟知识,接到 LLM 服务上了 5. 理解性能数字究竟在衡量什么|10 分钟 三个概念:TTFT 看第一段输出等多久;ITL 看流式输出的间隔;TPOT 看除首 token 外,平均每个输出 token 的耗时 5. 最后把这些概念接回数据|5 分钟 读 Workloads 和 Trace Format,看懂到达时间、输入长度、输出长度、前缀块 hash 四项。带着一个问题读:这些记录能描述哪些负载特征,哪些东西仍然必须在真实 GPU 服务里测?
6. 读完后思考 10 分钟 一个长请求进来以后,短请求为什么可能变慢?开启缓存以后,哪些成本减少了,哪些等待仍然存在?如果你能通俗易懂地解释了,说明这一个小时没白过 这一个小时的教程是我为投研团队成员准备的。
他是我在@meta 的前同事,和我一起合作了很多 Marvell 的分析 他现在是在硅谷某个大厂的 SDE,对 AI infra 一窍不通,我在督促他建立一个 X 的账号,让他分享起来。从 Day One 开始,分享他从普通 SDE 转到 AI 的学习路径,相信会对很多人有帮助,坚持下来,大家的水平应该可以拉齐