外观
论文地图:模型部署领域的全景图谱
这张地图把模型部署领域的代表性论文按 6 个主题 分组,每篇给出一句话贡献,并标注本站的精读位置。用途有两个:读之前用它规划路径(哪篇该读、和已读的什么关系),读之后用它复查全貌(我有没有漏掉某个方向)。
如何读这张地图
「本站精读位置」列:有精读页的给出链接;标注「未精读」的(剪枝、低秩、投机解码等)会在对应概念页里讲解,按需再深挖。
一、量化(Quantization)
主线问题:把权重(和激活)从 FP16/FP32 压到 INT8/INT4,显存减半、推理提速,但精度不能崩。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| LLM.int8()(Dettmers et al.) | 2022 / NeurIPS 2022 | 发现激活离群值是 INT8 崩坏的原因,用「离群特征 FP16 + 其余 INT8」的混合精度分解,让 175B 模型单卡 INT8 推理零性能退化 | 量化经典 |
| GPTQ(Frantar et al.) | 2023 / ICLR 2023 | 基于 Hessian 的逐层权重量化,175B 模型量化到 3/4-bit 接近 FP16,单 GPU 约 4 GPU-hours 完成 | 量化经典 |
| AWQ(Lin et al.) | 2023 / MLSys 2024(Best Paper) | 按激活幅度保护 ~1% 重要权重 + 等效缩放,4-bit 量化硬件友好、泛化强 | 量化经典 |
| SmoothQuant(Xiao et al.) | 2023 / ICML 2023 | 把量化难度从激活「迁移」到权重(数学等价变换),让 W8A8 对 LLM 可行,1.56x 加速 | 量化经典 |
二、蒸馏(Knowledge Distillation)
主线问题:用大模型(teacher)的软输出教小模型(student),「用训练成本换推理成本」。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| Distilling the Knowledge in a Neural Network(Hinton et al.) | 2015 / NIPS 2014 DL Workshop | 提出蒸馏:软标签 + 温度 T 让知识可迁移,学生网络比直接训练收敛更好 | 蒸馏经典 |
| DistilBERT(Sanh et al.) | 2019 / NeurIPS 2019 EMC² Workshop | 预训练阶段蒸馏:40% 参数、保留 97% 性能、快 60% | 蒸馏经典 |
| TinyBERT(Jiao et al.) | 2020 / EMNLP 2020 Findings | 两阶段蒸馏 + 注意力矩阵蒸馏,4 层模型 96.8% 性能、9.4x 更快 | 蒸馏经典 |
| MiniLM(Wang et al.) | 2020 / EMNLP 2020 Findings | 蒸馏自注意力内部关系(QK^T 与 V^T V),50% 参数保留 99%+ 准确率 | 蒸馏经典 |
三、模型压缩:剪枝与低秩(Pruning & Low-Rank)
主线问题:量化之外的两条压缩路线——去掉不重要的权重(剪枝)、用低秩近似替换大矩阵(低秩分解)。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| Learning both Weights and Connections for Efficient Neural Networks(Han et al.) | 2015 / NIPS 2015 | 经典剪枝:训练 → 剪掉小权重 → 重训练,AlexNet/VGG 压缩 9-13x 且精度不变 | 未精读,见模型压缩 |
| Exploiting Linear Structure Within Convolutional Networks(Denton et al.) | 2014 / NIPS 2014 | 用 SVD 把卷积核分解成低秩近似,2-3x 加速且精度损失小——低秩分解的起点 | 未精读,见模型压缩 |
| LoRA: Low-Rank Adaptation(Hu et al.) | 2021 / ICLR 2022 | 低秩思想进入大模型:冻结原权重、只训低秩增量,微调显存与存储暴降 | 未精读,见大模型推理优化 |
四、推理服务系统(Inference Serving Systems)
主线问题:把模型跑成「高吞吐、低延迟、可管理」的在线服务,系统如何调度请求与资源。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| TensorFlow-Serving(Olston et al.) | 2016 系统 / 2017 论文 | 第一个产品级模型服务框架:servable 版本管理、热加载、动态批处理、gRPC | 服务系统 |
| Clipper(Crankshaw et al.) | 2017 / NSDI 2017 | 通用低延迟预测服务层:缓存 + 延迟感知批处理 + 自适应模型选择 | 服务系统 |
| Nexus(Shen et al.) | 2019 / SOSP 2019 | GPU 集群推理引擎:把 DNN 拆成片段调度、多应用共享 GPU,延迟约束下吞吐比 SOTA 高 1.8-12.7x | 服务系统 |
| Orca(Yu et al.) | 2022 / OSDI 2022 | 迭代级调度(iteration-level scheduling):按迭代而非按请求换批,GPT-3 175B 吞吐比 FasterTransformer 高 36.9x,连续批处理前身 | 服务系统 |
| Efficient Memory Management with PagedAttention(Kwon et al.) | 2023 / SOSP 2023 | 把 OS 虚拟内存分页引入 KV Cache 管理,近零浪费 + 前缀共享,吞吐 2-4x | vLLM 论文 |
五、并行与分布式(Parallelism & Distribution)
主线问题:模型放不进单卡怎么办?在数据、层、矩阵、状态四个维度切分。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| Megatron-LM(Shoeybi et al.) | 2019 / arXiv | 张量并行:层内矩阵按行/列切分到多卡,8.3B 模型 512 卡 15.1 PFLOPS、76% 扩展效率 | 并行与分布式 |
| GPipe(Huang et al.) | 2018 / arXiv | 流水并行:层按阶段切分到多卡 + 微批流水化,6B 参数 128 层 Transformer 接近线性加速 | 并行与分布式 |
| DeepSpeed ZeRO(Rajbhandari et al.) | 2019 / arXiv | 三阶段消除冗余:优化器状态 → 梯度 → 参数分区,100B+ 参数 400 卡超线性扩展 | 并行与分布式 |
六、LLM 推理(LLM Inference)
主线问题:自回归生成的显存与调度难题——KV Cache、连续批处理、加速生成。
| 论文 | 年份/会议 | 一句话贡献 | 本站精读位置 |
|---|---|---|---|
| vLLM / PagedAttention(Kwon et al.) | 2023 / SOSP 2023 | KV Cache 分页管理 + 连续批处理,吞吐 2-4x,LLM 推理系统的分水岭 | vLLM 论文 |
| Fast Inference from Transformers via Speculative Decoding(Leviathan et al.) | 2023 / ICML 2023 | 小模型起草 + 大模型验证,LLM 生成提速 2-3x,不需要改动模型 | 未精读,见大模型推理优化 |
| Accelerating LLM Decoding with Speculative Sampling(Chen et al.) | 2023 / arXiv | 并行方案:一次验证多个草稿 token,数学上保证输出分布不变 | 未精读,见大模型推理优化 |
同一篇论文会出现在多个主题
地图按主题分组,论文可以跨组出现(如 PagedAttention 同时是「推理服务系统」和「LLM 推理」的代表)。这是有意为之——同一篇论文从不同角度看,能学到不同的东西。
按时间线看趋势
把上表按年份排列,模型部署领域的主线清晰可见:
text
2014-2016 2017-2019 2020-2022 2022-至今
┌─────────┐ ┌─────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ 压缩萌芽 │→│ 压缩实用化 │→│ 并行与大模型训练 │→ │ LLM 推理系统化 │
│ 剪枝/蒸馏│ │ 服务系统化 │ │ Megatron/GPipe/ │ │ Orca→vLLM │
│ 低秩/SVD │ │ TFServing/Clipper│ │ ZeRO │ │ LLM.int8/GPTQ/ │
│ │ │ DistilBERT │ │ GPTQ/AWQ 前夜 │ │ AWQ/SmoothQuant │
│ │ │ 量化为工程问题 │ │ │ │ 投机解码/前缀缓存 │
└─────────┘ └─────────────────┘ └──────────────────┘ └──────────────────┘
压缩起步 从「算法」到「系统」 训练侧的规模战 推理侧的效率战四条趋势:
- 从「把模型变小」到「把系统做聪明」:2015-2019 的主角是压缩算法(剪枝、蒸馏、量化);2022 之后主角变成调度器与显存管理(Orca、vLLM)。当模型本身变不了小时,胜负手在系统。
- 训练侧技术大规模迁移到推理侧:张量并行(Megatron)、显存分区(ZeRO)本是训练技术,现在都成了大模型推理的标准配置;流水并行也正在被推理引擎吸收。
- LLM 量化两年内走完一个时代:2022 年 LLM.int8 只能「凑合着不崩」,2023 年 GPTQ/AWQ 做到 4-bit 接近无损,SmoothQuant 让 W8A8 上线——量化从「能不能」变成「怎么选」。
- KV Cache 成为新的基础设施:PagedAttention 之后,前缀缓存、chunked prefill、KV 压缩(如 GQA 相关)成为新论文的密集产出区——这正是部署工程师未来两三年要持续跟进的战场,见大模型推理优化。
延伸阅读
- 论文精读:从这里开始 —— 三遍法与笔记模板
- 阅读路径 —— 三条按主题组织的阅读路线
- 量化经典:LLM.int8 / GPTQ / AWQ
- 蒸馏经典:KD 与蒸馏家族
- PagedAttention:vLLM 系统论文
- 推理服务系统:Clipper / Orca / Nexus 等
- 并行与分布式推理
- 部署演进简史 —— 地图的「时间线」视角与工具演进对照