Skip to content

论文精读:从这里开始

本页速览 为什么部署工程师要读论文?本文说明论文精读模块的用法:读论文的方法(三遍法)、按主题的推荐阅读顺序,以及每篇精读页的入口。

论文精读:从这里开始

部署工程师的工作表面上是「把模型跑起来、把服务调稳」,但决定天花板的是对工具背后原理的理解。vLLM 为什么快?GPTQ 和 AWQ 差在哪?量化为什么对小模型不友好?——这些问题的答案都写在论文里,而不是 README 里。本栏目用「一篇一篇讲清楚」的方式,带你读模型部署领域的十几篇经典论文。

为什么部署工程师要读论文

读论文的直接收益有三层:

  1. 理解工具背后的原理:vLLM 的 PagedAttention 抄的是操作系统虚拟内存;Triton 的多模型调度承袭了 Clipper 的批处理思想;量化工具箱里每个算法的取舍都有论文依据。读懂原理,你就从「会调参数」升级到「知道为什么是这个参数」。
  2. 面对新问题有判断力:当出现一个新框架、新算法,你能快速判断它解决了哪个旧痛点、它和已有方案的关系——这比追着每个新博客跑要高效得多。
  3. 沟通与面试的通用语言:面试官问「为什么选 AWQ 而不是 GPTQ」,问的就是你有没有把论文读成自己的判断。详见职业路径

如果你还没建立「部署全景」的框架,建议先读什么是模型部署部署演进简史,再回来读论文——论文是给「有框架的人」看细节的。

读论文的方法:三遍法

不要指望一遍读懂。学术界通行的做法是 三遍法(源自 S. Keshav 的 How to Read a Paper,被广泛采用):

遍数做什么时长读完应该能回答
第一遍:摘要略读读标题、摘要、目录、图表标题、结论。回答三个问题:这篇论文解决什么问题?核心贡献是什么?和我知道的方案有什么关系?5-15 分钟「一句话贡献」(本栏目每篇精读都给你这一句)
第二遍:图与结论细读所有图表、实验设置与关键数字,跳过推导。试图给同事讲一遍「方法大概怎么工作」。30-60 分钟方法的高层机制 + 关键数字(提速几倍、精度掉多少)
第三遍:方法细节逐节精读,自己推导公式、审视实验是否公平、想清楚局限在哪。这一步通常只在你要实现或复现时才做。1-3 小时能向别人完整复述,能指出论文的坑

部署工程师的「第二遍优先」策略

你不需要把每篇论文都读到第三遍。第一遍定取舍、第二遍建立认知,只有当你打算亲自实现、改造成落地时,才值得花时间读第三遍。本栏目的精读页相当于帮你完成了「第一遍 + 第二遍」的整理。

如何做笔记

  • 每篇论文用一张卡:一句话贡献 / 动机 / 方法一句话 / 3 个关键数字 / 局限 / 对今天的启示
  • 关键数字单独记,别只记结论——「2-4x」「99% 无退化」这类数字是面试和选型时最有用的弹药。
  • 把论文连成图谱:新读的论文和你已读的哪篇有关系?(Orca → vLLM → SGLang 是一条线;LLM.int8 → GPTQ → AWQ 是一条线。)本站论文地图就是这张图谱。

按主题的推荐阅读顺序

不知道从哪篇开始?三条推荐路径,从轻到重:

路径适合谁篇数阅读时长入口
新手入门刚接触部署、想建立语感3 篇半天到 1 天阅读路径:新手入门
系统进阶已在做部署、想补全理论底盘6 篇2-4 天阅读路径:系统进阶
LLM 推理专题正在做或准备做大模型推理4 篇1-2 天阅读路径:LLM 推理专题

每条路径都标注了前置知识(链接到 核心知识 各页)、阅读时长与「读后应该能回答的问题」,见阅读路径

本栏目全部论文页

页面内容
论文地图按主题分组的总览:量化、蒸馏、压缩、服务系统、并行、LLM 推理
量化经典:LLM.int8 / GPTQ / AWQLLM 量化的三篇里程碑,附 SmoothQuant
蒸馏经典:KD 与蒸馏家族Hinton KD、DistilBERT、TinyBERT、MiniLM
PagedAttention:vLLM 系统论文SOSP 2023 必读,KV Cache 分页 + 连续批处理
推理服务系统:Clipper / Orca / Nexus 等从 TensorFlow Serving 到 Orca 的服务系统谱系
并行与分布式推理Megatron-LM、GPipe、DeepSpeed ZeRO

关于「论文地图」里的非精读论文

本栏目精读的是 16 篇核心论文;论文地图 中还会列出剪枝、低秩、投机解码等「只标注、未精读」的相关论文,它们用来帮你建立完整的领域图谱,需要深入时再按图索骥。

阅读纪律与 FAQ

阅读纪律(写给拖延症):

  • 先读摘要,再决定要不要读全文——大多数论文 5 分钟内就能判断与你无关。
  • 一次只读一篇,读完立刻写那张「论文卡片」,别攒着。
  • 带着问题读:读之前先写下「我想从这篇论文里知道什么」,比漫无目的地读效率高一倍。
  • 复述即掌握:读完尝试用三句话讲给同事听,讲不出来的地方就是没读懂的地方。

FAQ:

  • 读不懂怎么办? 先按三遍法降级:读不懂方法细节(第三遍)很正常,第一遍、第二遍不要求你懂公式。绝大多数部署场景,第二遍的「图 + 数字」就够了。实在卡住,去查术语表和对应的 核心知识 页面,先补概念再回头读。
  • 数学基础要求多高? 本栏目涉及的论文不需要研究生数学:量化那篇用到一点线性代数直觉(矩阵乘、Hessian 的「二阶信息」当黑盒理解即可);蒸馏用到交叉熵;并行用到「矩阵怎么切」的直觉。公式以「文字化解释」为主,不追求严格推导
  • 论文和博客有什么区别,先读哪个? 博客帮你快速上手工具,论文告诉你「为什么」以及「边界在哪」。两者互补:先用本站的 实战案例 把工具跑起来,再回来读论文理解取舍。
  • 要不要读论文附录和开源代码? 第一遍、第二遍不需要。只有当你打算复现算法(比如自己实现量化方法)或评估某篇论文是否可直接落地时,才值得看代码。

延伸阅读