Skip to content

论文地图:模型部署领域的全景图谱

本页速览 模型部署领域的论文地图:量化、蒸馏、压缩、推理服务系统、并行与分布式、LLM 推理——按主题分组列出代表性论文与一句话贡献,并指向本站精读页。

论文地图:模型部署领域的全景图谱

这张地图把模型部署领域的代表性论文按 6 个主题 分组,每篇给出一句话贡献,并标注本站的精读位置。用途有两个:读之前用它规划路径(哪篇该读、和已读的什么关系),读之后用它复查全貌(我有没有漏掉某个方向)。

如何读这张地图

「本站精读位置」列:有精读页的给出链接;标注「未精读」的(剪枝、低秩、投机解码等)会在对应概念页里讲解,按需再深挖。

一、量化(Quantization)

主线问题:把权重(和激活)从 FP16/FP32 压到 INT8/INT4,显存减半、推理提速,但精度不能崩。

论文年份/会议一句话贡献本站精读位置
LLM.int8()(Dettmers et al.)2022 / NeurIPS 2022发现激活离群值是 INT8 崩坏的原因,用「离群特征 FP16 + 其余 INT8」的混合精度分解,让 175B 模型单卡 INT8 推理零性能退化量化经典
GPTQ(Frantar et al.)2023 / ICLR 2023基于 Hessian 的逐层权重量化,175B 模型量化到 3/4-bit 接近 FP16,单 GPU 约 4 GPU-hours 完成量化经典
AWQ(Lin et al.)2023 / MLSys 2024(Best Paper)按激活幅度保护 ~1% 重要权重 + 等效缩放,4-bit 量化硬件友好、泛化强量化经典
SmoothQuant(Xiao et al.)2023 / ICML 2023把量化难度从激活「迁移」到权重(数学等价变换),让 W8A8 对 LLM 可行,1.56x 加速量化经典

二、蒸馏(Knowledge Distillation)

主线问题:用大模型(teacher)的软输出教小模型(student),「用训练成本换推理成本」。

论文年份/会议一句话贡献本站精读位置
Distilling the Knowledge in a Neural Network(Hinton et al.)2015 / NIPS 2014 DL Workshop提出蒸馏:软标签 + 温度 T 让知识可迁移,学生网络比直接训练收敛更好蒸馏经典
DistilBERT(Sanh et al.)2019 / NeurIPS 2019 EMC² Workshop预训练阶段蒸馏:40% 参数、保留 97% 性能、快 60%蒸馏经典
TinyBERT(Jiao et al.)2020 / EMNLP 2020 Findings两阶段蒸馏 + 注意力矩阵蒸馏,4 层模型 96.8% 性能、9.4x 更快蒸馏经典
MiniLM(Wang et al.)2020 / EMNLP 2020 Findings蒸馏自注意力内部关系(QK^T 与 V^T V),50% 参数保留 99%+ 准确率蒸馏经典

三、模型压缩:剪枝与低秩(Pruning & Low-Rank)

主线问题:量化之外的两条压缩路线——去掉不重要的权重(剪枝)、用低秩近似替换大矩阵(低秩分解)。

论文年份/会议一句话贡献本站精读位置
Learning both Weights and Connections for Efficient Neural Networks(Han et al.)2015 / NIPS 2015经典剪枝:训练 → 剪掉小权重 → 重训练,AlexNet/VGG 压缩 9-13x 且精度不变未精读,见模型压缩
Exploiting Linear Structure Within Convolutional Networks(Denton et al.)2014 / NIPS 2014用 SVD 把卷积核分解成低秩近似,2-3x 加速且精度损失小——低秩分解的起点未精读,见模型压缩
LoRA: Low-Rank Adaptation(Hu et al.)2021 / ICLR 2022低秩思想进入大模型:冻结原权重、只训低秩增量,微调显存与存储暴降未精读,见大模型推理优化

四、推理服务系统(Inference Serving Systems)

主线问题:把模型跑成「高吞吐、低延迟、可管理」的在线服务,系统如何调度请求与资源。

论文年份/会议一句话贡献本站精读位置
TensorFlow-Serving(Olston et al.)2016 系统 / 2017 论文第一个产品级模型服务框架:servable 版本管理、热加载、动态批处理、gRPC服务系统
Clipper(Crankshaw et al.)2017 / NSDI 2017通用低延迟预测服务层:缓存 + 延迟感知批处理 + 自适应模型选择服务系统
Nexus(Shen et al.)2019 / SOSP 2019GPU 集群推理引擎:把 DNN 拆成片段调度、多应用共享 GPU,延迟约束下吞吐比 SOTA 高 1.8-12.7x服务系统
Orca(Yu et al.)2022 / OSDI 2022迭代级调度(iteration-level scheduling):按迭代而非按请求换批,GPT-3 175B 吞吐比 FasterTransformer 高 36.9x,连续批处理前身服务系统
Efficient Memory Management with PagedAttention(Kwon et al.)2023 / SOSP 2023把 OS 虚拟内存分页引入 KV Cache 管理,近零浪费 + 前缀共享,吞吐 2-4xvLLM 论文

五、并行与分布式(Parallelism & Distribution)

主线问题:模型放不进单卡怎么办?在数据、层、矩阵、状态四个维度切分。

论文年份/会议一句话贡献本站精读位置
Megatron-LM(Shoeybi et al.)2019 / arXiv张量并行:层内矩阵按行/列切分到多卡,8.3B 模型 512 卡 15.1 PFLOPS、76% 扩展效率并行与分布式
GPipe(Huang et al.)2018 / arXiv流水并行:层按阶段切分到多卡 + 微批流水化,6B 参数 128 层 Transformer 接近线性加速并行与分布式
DeepSpeed ZeRO(Rajbhandari et al.)2019 / arXiv三阶段消除冗余:优化器状态 → 梯度 → 参数分区,100B+ 参数 400 卡超线性扩展并行与分布式

六、LLM 推理(LLM Inference)

主线问题:自回归生成的显存与调度难题——KV Cache、连续批处理、加速生成。

论文年份/会议一句话贡献本站精读位置
vLLM / PagedAttention(Kwon et al.)2023 / SOSP 2023KV Cache 分页管理 + 连续批处理,吞吐 2-4x,LLM 推理系统的分水岭vLLM 论文
Fast Inference from Transformers via Speculative Decoding(Leviathan et al.)2023 / ICML 2023小模型起草 + 大模型验证,LLM 生成提速 2-3x,不需要改动模型未精读,见大模型推理优化
Accelerating LLM Decoding with Speculative Sampling(Chen et al.)2023 / arXiv并行方案:一次验证多个草稿 token,数学上保证输出分布不变未精读,见大模型推理优化

同一篇论文会出现在多个主题

地图按主题分组,论文可以跨组出现(如 PagedAttention 同时是「推理服务系统」和「LLM 推理」的代表)。这是有意为之——同一篇论文从不同角度看,能学到不同的东西

按时间线看趋势

把上表按年份排列,模型部署领域的主线清晰可见:

text
2014-2016   2017-2019            2020-2022              2022-至今
┌─────────┐ ┌─────────────────┐ ┌──────────────────┐  ┌──────────────────┐
│ 压缩萌芽  │→│ 压缩实用化        │→│ 并行与大模型训练    │→ │ LLM 推理系统化     │
│ 剪枝/蒸馏│ │ 服务系统化         │ │ Megatron/GPipe/  │  │ Orca→vLLM         │
│ 低秩/SVD │ │ TFServing/Clipper│ │ ZeRO             │  │ LLM.int8/GPTQ/    │
│          │ │ DistilBERT       │ │ GPTQ/AWQ 前夜     │  │ AWQ/SmoothQuant   │
│          │ │ 量化为工程问题     │ │                  │  │ 投机解码/前缀缓存   │
└─────────┘ └─────────────────┘ └──────────────────┘  └──────────────────┘
   压缩起步     从「算法」到「系统」     训练侧的规模战     推理侧的效率战

四条趋势:

  1. 从「把模型变小」到「把系统做聪明」:2015-2019 的主角是压缩算法(剪枝、蒸馏、量化);2022 之后主角变成调度器与显存管理(Orca、vLLM)。当模型本身变不了小时,胜负手在系统
  2. 训练侧技术大规模迁移到推理侧:张量并行(Megatron)、显存分区(ZeRO)本是训练技术,现在都成了大模型推理的标准配置;流水并行也正在被推理引擎吸收。
  3. LLM 量化两年内走完一个时代:2022 年 LLM.int8 只能「凑合着不崩」,2023 年 GPTQ/AWQ 做到 4-bit 接近无损,SmoothQuant 让 W8A8 上线——量化从「能不能」变成「怎么选」
  4. KV Cache 成为新的基础设施:PagedAttention 之后,前缀缓存、chunked prefill、KV 压缩(如 GQA 相关)成为新论文的密集产出区——这正是部署工程师未来两三年要持续跟进的战场,见大模型推理优化

延伸阅读