AI Pulse
📡 X 信号

当前需求旺盛的AI岗位:推理工程

当前需求旺盛的AI岗位:推理工程

推理工程是在AI领域需求很高,但同时供给相对较少的方向之一,尤其是在美国和欧洲市场,我认为海湾地区市场很快也会跟上。

企业现在不仅需要懂得搭建和训练模型的人,还需要懂得如何高效地为数百万用户运行大语言模型(LLM)、视觉语言模型(VLM)以及语音识别/语音合成(STT/TTS)服务,并尽可能降低成本。

我整理了相关资源,做成了下面这个学习路径:

1. 先从大语言模型推理的基础知识开始
你首先需要理解单个请求的生命周期,必须理解以下概念:
- 分词(Tokenization)
- 前向传播(Forward pass)
- 自回归生成(Autoregressive generation)
- 预填充(Prefill)
- 解码(Decode)
- KV缓存(KV cache)
- 首个token时延(TTFT)与每token时延(ITL)
- 吞吐量与时延(Throughput vs. latency)

参考资料:
- NVIDIA AI Engineering演讲
- Hugging Face — 基于TGI的大规模大语言模型推理
- Abi Aryan — 预填充 vs 解码

2. 理解Transformer内部基础
你需要从头回顾Transformer架构的全部知识,重点关注和推理直接相关的内容:
- Transformer块
- 嵌入(Embeddings)
- 自注意力
- Q、K、V
- 产生KV缓存的注意力机制

能帮你建立这个主题直观认知的最好资料之一是:
- Brendan Bycroft 大语言模型可视化工具

3. 至少对GPU建立基础的心智模型
尝试理解:
- GPU架构
- 流式多处理器(Streaming Multiprocessors)
- HBM vs. SRAM
- 内存层次结构
- 内存带宽
- FLOPS
- 运算强度
- 计算受限 vs 内存受限任务

推理优化很大一部分内容就是,你不止要思考模型本身,还要思考数据在GPU里是如何流动的。以下资料很有用:
- Horace He — 从第一原理出发让深度学习跑起来
- Damek Davis — GPU基础常识

4. 接下来学习推理优化技术
当你理解了基础和硬件之后,这些技术就不只是一堆零散技巧了。重点关注:
量化、分页注意力(PagedAttention)、FlashAttention、分块预填充(Chunked prefill)、推测解码(Speculative decoding)、Prompt/Prefix缓存、连续批处理(Continuous batching)

NVIDIA有一个非常好的该主题概述:
- 掌握大语言模型技术:推理优化

之后,你可以去读和实际运行的系统直接相关的原始论文。

5. 最后,选择一款推理引擎来实践,甚至可以给它们做开源贡献。
你前面学到的所有概念都会整合到同一个系统里,选一个引擎,弄清楚请求是如何一步步处理的,包括:
- 调度(Scheduling)
- 批处理(Batching)
- KV缓存管理
- 内存分配
- 执行
- 服务

你可以从以下三款引擎入门:
- vLLM:如果你关注通用高吞吐量大语言模型服务,这是个很棒的选择。
- SGLang:特别适合有可复用前缀的任务,或是多轮对话、智能体系统这类复杂大语言模型程序。
- llama.cpp:如果你关注本地推理、CPU、消费级硬件或是边缘部署,选它就对了。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新