外观
论文精读:从这里开始
部署工程师的工作表面上是「把模型跑起来、把服务调稳」,但决定天花板的是对工具背后原理的理解。vLLM 为什么快?GPTQ 和 AWQ 差在哪?量化为什么对小模型不友好?——这些问题的答案都写在论文里,而不是 README 里。本栏目用「一篇一篇讲清楚」的方式,带你读模型部署领域的十几篇经典论文。
为什么部署工程师要读论文
读论文的直接收益有三层:
- 理解工具背后的原理:vLLM 的 PagedAttention 抄的是操作系统虚拟内存;Triton 的多模型调度承袭了 Clipper 的批处理思想;量化工具箱里每个算法的取舍都有论文依据。读懂原理,你就从「会调参数」升级到「知道为什么是这个参数」。
- 面对新问题有判断力:当出现一个新框架、新算法,你能快速判断它解决了哪个旧痛点、它和已有方案的关系——这比追着每个新博客跑要高效得多。
- 沟通与面试的通用语言:面试官问「为什么选 AWQ 而不是 GPTQ」,问的就是你有没有把论文读成自己的判断。详见职业路径。
如果你还没建立「部署全景」的框架,建议先读什么是模型部署与部署演进简史,再回来读论文——论文是给「有框架的人」看细节的。
读论文的方法:三遍法
不要指望一遍读懂。学术界通行的做法是 三遍法(源自 S. Keshav 的 How to Read a Paper,被广泛采用):
| 遍数 | 做什么 | 时长 | 读完应该能回答 |
|---|---|---|---|
| 第一遍:摘要略读 | 读标题、摘要、目录、图表标题、结论。回答三个问题:这篇论文解决什么问题?核心贡献是什么?和我知道的方案有什么关系? | 5-15 分钟 | 「一句话贡献」(本栏目每篇精读都给你这一句) |
| 第二遍:图与结论 | 细读所有图表、实验设置与关键数字,跳过推导。试图给同事讲一遍「方法大概怎么工作」。 | 30-60 分钟 | 方法的高层机制 + 关键数字(提速几倍、精度掉多少) |
| 第三遍:方法细节 | 逐节精读,自己推导公式、审视实验是否公平、想清楚局限在哪。这一步通常只在你要实现或复现时才做。 | 1-3 小时 | 能向别人完整复述,能指出论文的坑 |
部署工程师的「第二遍优先」策略
你不需要把每篇论文都读到第三遍。第一遍定取舍、第二遍建立认知,只有当你打算亲自实现、改造成落地时,才值得花时间读第三遍。本栏目的精读页相当于帮你完成了「第一遍 + 第二遍」的整理。
如何做笔记:
- 每篇论文用一张卡:
一句话贡献 / 动机 / 方法一句话 / 3 个关键数字 / 局限 / 对今天的启示。 - 关键数字单独记,别只记结论——「2-4x」「99% 无退化」这类数字是面试和选型时最有用的弹药。
- 把论文连成图谱:新读的论文和你已读的哪篇有关系?(Orca → vLLM → SGLang 是一条线;LLM.int8 → GPTQ → AWQ 是一条线。)本站论文地图就是这张图谱。
按主题的推荐阅读顺序
不知道从哪篇开始?三条推荐路径,从轻到重:
| 路径 | 适合谁 | 篇数 | 阅读时长 | 入口 |
|---|---|---|---|---|
| 新手入门 | 刚接触部署、想建立语感 | 3 篇 | 半天到 1 天 | 阅读路径:新手入门 |
| 系统进阶 | 已在做部署、想补全理论底盘 | 6 篇 | 2-4 天 | 阅读路径:系统进阶 |
| LLM 推理专题 | 正在做或准备做大模型推理 | 4 篇 | 1-2 天 | 阅读路径:LLM 推理专题 |
每条路径都标注了前置知识(链接到 核心知识 各页)、阅读时长与「读后应该能回答的问题」,见阅读路径。
本栏目全部论文页
| 页面 | 内容 |
|---|---|
| 论文地图 | 按主题分组的总览:量化、蒸馏、压缩、服务系统、并行、LLM 推理 |
| 量化经典:LLM.int8 / GPTQ / AWQ | LLM 量化的三篇里程碑,附 SmoothQuant |
| 蒸馏经典:KD 与蒸馏家族 | Hinton KD、DistilBERT、TinyBERT、MiniLM |
| PagedAttention:vLLM 系统论文 | SOSP 2023 必读,KV Cache 分页 + 连续批处理 |
| 推理服务系统:Clipper / Orca / Nexus 等 | 从 TensorFlow Serving 到 Orca 的服务系统谱系 |
| 并行与分布式推理 | Megatron-LM、GPipe、DeepSpeed ZeRO |
关于「论文地图」里的非精读论文
本栏目精读的是 16 篇核心论文;论文地图 中还会列出剪枝、低秩、投机解码等「只标注、未精读」的相关论文,它们用来帮你建立完整的领域图谱,需要深入时再按图索骥。
阅读纪律与 FAQ
阅读纪律(写给拖延症):
- 先读摘要,再决定要不要读全文——大多数论文 5 分钟内就能判断与你无关。
- 一次只读一篇,读完立刻写那张「论文卡片」,别攒着。
- 带着问题读:读之前先写下「我想从这篇论文里知道什么」,比漫无目的地读效率高一倍。
- 复述即掌握:读完尝试用三句话讲给同事听,讲不出来的地方就是没读懂的地方。
FAQ:
- 读不懂怎么办? 先按三遍法降级:读不懂方法细节(第三遍)很正常,第一遍、第二遍不要求你懂公式。绝大多数部署场景,第二遍的「图 + 数字」就够了。实在卡住,去查术语表和对应的 核心知识 页面,先补概念再回头读。
- 数学基础要求多高? 本栏目涉及的论文不需要研究生数学:量化那篇用到一点线性代数直觉(矩阵乘、Hessian 的「二阶信息」当黑盒理解即可);蒸馏用到交叉熵;并行用到「矩阵怎么切」的直觉。公式以「文字化解释」为主,不追求严格推导。
- 论文和博客有什么区别,先读哪个? 博客帮你快速上手工具,论文告诉你「为什么」以及「边界在哪」。两者互补:先用本站的 实战案例 把工具跑起来,再回来读论文理解取舍。
- 要不要读论文附录和开源代码? 第一遍、第二遍不需要。只有当你打算复现算法(比如自己实现量化方法)或评估某篇论文是否可直接落地时,才值得看代码。
延伸阅读
- 阅读路径:三条路径怎么选 —— 新手入门 / 系统进阶 / LLM 推理专题
- 论文地图:一句话看懂 30+ 篇论文 —— 建立领域全貌
- 部署演进简史 —— 论文与工具的时间线背景
- 术语表 —— 读论文遇到术语时的速查手册
- 核心知识:推理 —— 读论文前的概念底座