这位AI工程师整理了10周LLM推理入门计划
作为AI工程师,请学习以下内容:
- 学习roofline模型,以及为什么解码是内存绑定的
- 部署vLLM和SGLang,然后阅读它们的调度器
- 从代码中理解paged attention,而不是从博客文章
- 在优化任何内容之前先搭建可观测性
- 跟踪TTFT、Token间延迟、吞吐量、队列深度
- 使用Grafana + Prometheus搭建推理仪表盘
- 开启prefix caching,找出哪些工作负载能从中受益
- 学习continuous batching和chunked prefill
- 用1000+并发请求运行压力测试
- 报告p50、p95、p99,永远不要只报平均值
- 掌握量化的权衡(FP8、INT4、AWQ、GPTQ)
- 学习speculative decoding,找出它什么时候不再起作用
- 为长上下文配置KV cache eviction
- 尝试disaggregated prefill和decode serving
- 学习Kubernetes处理AI工作负载,并根据队列深度自动扩缩容
- 了解推理成本如何影响单位经济模型
- 按成本、延迟、质量搭建你自己的模型路由
- 为每个请求创建Token预算系统
- 搭建一个推理服务并公开做基准测试
- 读推理相关研究,而不是只看模型发布新闻
- 开始分享你的优化基准测试
我整理了一个10周计划,每天花30分钟就能覆盖以上所有内容。一共有50个环节,分为阅读理论和在自己的服务上实践两部分,所有环节最终产出一个成果:一个你自己部署、 instrumentation、压测超过1000并发请求、调优过,并且作为可复现基准公开的推理服务。
该计划已经在GitHub开源,欢迎贡献,尤其欢迎添加值得加入的新资料。我自己也正在跟进这个计划,未来会分享更多内容,敬请期待。
GitHub仓库:(别忘了点星🌟)
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖