AI Pulse
📡 X 信号

从零构建推理第二季:讲解大语言模型文本生成与KV缓存

从零构建推理第二季:讲解大语言模型文本生成与KV缓存

从零推理第二回合:在这个视频中,我会讲解大语言模型的文本生成过程和KV缓存(为后续视频添加推理技术之前准备好基础模型)。

00:00 引言和推理模型演示
01:55 如何使用本书学习
05:00 第二章概览
08:25 检查PyTorch和硬件支持
10:26 Apple硅和MPS注意事项
15:00 云GPU选项
16:08 Token和分词
18:20 Qwen3和「从零推理」包
23:05 文本编码与解码
26:24 下载权重和选择设备
31:01 加载预训练Qwen3模型
34:32 大语言模型如何生成文本
36:47 输入张量和批次维度
41:48 在推理模式下运行模型
44:11 对数概率和下一个token预测

49:21 使用argmax的贪心解码
52:28 构建流式文本生成器
01:01:28 生成文本和处理序列结束token
01:06:00 文本生成性能基准测试
01:14:34 KV缓存的工作原理
01:17:22 添加KV缓存并测量加速比
01:24:31 使用torch.compile进行模型编译
01:30:33 结合编译和KV缓存
01:32:53 对比CPU和GPU性能
01:35:32 回顾和下一步计划

以下是YouTube版本:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新