部署 vs MLOps vs 推理 vs 模型服务:五个高频词一次厘清
模型部署、MLOps、推理、模型服务、推理引擎——五个高频词经常混用。本文逐一厘清边界:谁是谁的子集、在流水线里各占哪一段,并给出统一视角的部署流水线全景。
MODEL DEPLOYMENT HANDBOOK
从训练完成到稳定服务的系统化知识 —— 推理引擎 · 模型压缩 · 服务化与部署架构 · 性能优化 · 监控与 MLOps · LLM 推理 · 职业路径
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
只读十篇的话,读这些
模型部署是把训练好的模型变成可持续提供预测服务的生产系统。本文给出精确定义、部署的四要素、与训练的本质区别、模型系统的独特挑战(漂移、效果退化),以及部署工程师到底在解决什么问题。
导读一个生产级推理系统由哪些部分组成?本文用一张全景图解剖推理系统的七层结构——请求入口、服务层、推理引擎、资源层、数据与版本、可观测性、治理——讲清每层职责、常见故障点与层间协作。
导读LLM 推理是当前模型部署最热的前沿:自回归生成、KV Cache、连续批处理、投机解码、张量并行。本文系统讲清大模型推理的显存账本与每一项优化手段。
核心知识没有监控的模型部署等于裸奔。本文讲清推理服务的四类黄金指标、ML 特有的数据/概念漂移检测、日志指标追踪三支柱,以及告警与 On-call 机制。
核心知识量化用更低位的数值表示权重与激活,是性价比最高的模型加速与瘦身手段。本文讲清 FP16/BF16/INT8/INT4 的取舍、PTQ 与 QAT、权重量化与激活量化,以及 LLM 时代的 GPTQ/AWQ/GGUF。
核心知识推理(inference)是模型上线后的每一次前向传播。本文讲透推理的本质、与训练的根本差异、一次推理的延迟构成,以及推理引擎在做什么——图优化、算子融合、kernel 选择。
核心知识把训练好的 PyTorch 模型封装成 FastAPI 在线服务并 Docker 化的完整实战:模型导出、预处理/后处理封装、gunicorn 多进程部署、健康检查与常见坑。
实战案例用 vLLM 部署开源大模型(如 Qwen/Llama)并暴露 OpenAI 兼容 API 的实战:启动参数调优、量化模型加载、张量并行、压测与常见问题。
实战案例vLLM 论文(SOSP 2023)是本领域必读:把操作系统虚拟内存分页的思想引入 KV Cache 管理,消除显存碎片,配合连续批处理让吞吐提升 2-4 倍。本文逐节精读。
论文精读部署翻车现场合集:训练/推理不一致、量化精度崩塌未发现、显存泄漏、无监控裸奔、一次性全量发布……每个坑都给出「症状→原因→解法」,全是血泪经验,附部署前 10 条自检清单。
实践指南用最小可用路径走通「训练→导出→服务→压测→监控」完整部署闭环:每一步给出可运行代码、仓库目录结构、常见坑与进阶方向,学完即拥有一套可复用的部署骨架。
实践指南部署方向面试高频题 80+:推理引擎原理、量化、服务化、K8s 与容器、监控、MLOps、LLM 推理、系统设计——每题附参考答案要点与追问方向,是你求职冲刺的终局题库。
职业路径按模块浏览,或直接搜索
模型部署、MLOps、推理、模型服务、推理引擎——五个高频词经常混用。本文逐一厘清边界:谁是谁的子集、在流水线里各占哪一段,并给出统一视角的部署流水线全景。
从 2015 年的「脚本 + 手工复制权重」到今天的 vLLM 连续批处理与云原生推理平台,模型部署十年走过了怎样的路?本文按时间线梳理四个时代的关键工具、痛点与转折,帮你理解今天每个工具的由来。
模型部署是把训练好的模型变成可持续提供预测服务的生产系统。本文给出精确定义、部署的四要素、与训练的本质区别、模型系统的独特挑战(漂移、效果退化),以及部署工程师到底在解决什么问题。
一个生产级推理系统由哪些部分组成?本文用一张全景图解剖推理系统的七层结构——请求入口、服务层、推理引擎、资源层、数据与版本、可观测性、治理——讲清每层职责、常见故障点与层间协作。
模型部署知识零散不成体系?本文给出三条学习路线——求职冲刺(约 2 周)、系统精进(约 8 周)、案头速查(随用随查),每条路线都有按主题组织的页面清单与检验标准。
模型上线后暴露在公网,安全风险随之而来:模型窃取、提示注入、对抗攻击、数据泄露。本文给出推理服务的安全基线:认证授权、输入防护、隐私保护与合规要点。
在线、批处理、流式、边缘、Serverless——五种部署架构各有适用场景。本文给出完整对比表与选型决策树,并讨论混合部署。
LLM 推理是当前模型部署最热的前沿:自回归生成、KV Cache、连续批处理、投机解码、张量并行。本文系统讲清大模型推理的显存账本与每一项优化手段。
服务化(serving)是把模型封装成可调用 API 的关键一跃。本文讲清在线推理服务的本质、HTTP/gRPC 协议选择、输入输出设计、预处理后处理封装,以及模型生命周期管理。
没有监控的模型部署等于裸奔。本文讲清推理服务的四类黄金指标、ML 特有的数据/概念漂移检测、日志指标追踪三支柱,以及告警与 On-call 机制。
量化用更低位的数值表示权重与激活,是性价比最高的模型加速与瘦身手段。本文讲清 FP16/BF16/INT8/INT4 的取舍、PTQ 与 QAT、权重量化与激活量化,以及 LLM 时代的 GPTQ/AWQ/GGUF。
PyTorch 的 .pt 到 ONNX、TensorRT、TFLite、GGUF——模型格式决定你能否在目标硬件上高效推理。本文盘点主流格式、转换流程、算子兼容陷阱与转换后的数值校验。
推理(inference)是模型上线后的每一次前向传播。本文讲透推理的本质、与训练的根本差异、一次推理的延迟构成,以及推理引擎在做什么——图优化、算子融合、kernel 选择。
延迟、吞吐、成本是推理服务的三角权衡。本文给出性能指标体系(P50/P99/QPS/TTFT/TPOT)、四层优化手段(模型→引擎→服务→系统)与容量规划方法。
量化之外,蒸馏、剪枝、低秩分解是另三条模型瘦身路线。本文对比三种技术的原理、适用场景与组合策略,帮你决定该用哪一招。
模型能不能跑、跑多快,一半由硬件决定。本文讲清 GPU 关键参数(显存、带宽、算力)、显存与模型大小的换算、CPU/GPU/NPU/TPU 对比,以及推理场景的实例选型思路。
模型的 CI/CD 与代码不同:要管模型版本、数据版本与效果回归。本文讲清从提交到上线的部署流水线——模型注册、测试关卡、灰度发布与回滚。
多个模型版本/多个模型并存时,网关负责路由、限流、灰度与 A/B。本文实战用 Nginx/Envoy + 应用层路由实现模型网关,并给出金丝雀发布与 A/B 实验的完整流程。
离线批量推理(画像更新、日报评分)与在线推理的成本差一个数量级。本文实战用 Airflow + Python/Spark 构建可重试、可断点续跑的批推理管道。
推荐系统的在线推理是延迟预算最紧的部署场景之一。本文拆解推荐链路(召回→粗排→精排→重排)中各模型如何部署、特征怎么取、多模型如何串联,以及延迟预算怎么分配。
把训练好的 PyTorch 模型封装成 FastAPI 在线服务并 Docker 化的完整实战:模型导出、预处理/后处理封装、gunicorn 多进程部署、健康检查与常见坑。
用 NVIDIA Triton Inference Server 托管多个模型、开启动态批处理与并发调度的完整实战:模型仓库结构、config.pbtxt 编写、性能指标与压测对比。
低频、突发、按调用计费的推理场景用 Serverless 最划算。本文实战 AWS Lambda(或云函数)部署推理服务,重点解决冷启动,并对比常驻服务的成本模型。
把模型优化成 TensorRT engine 再部署到边缘设备(Jetson)的实战:ONNX→TRT 转换、FP16/INT8 精度权衡、动态 shape、边缘部署与功耗约束。
用 vLLM 部署开源大模型(如 Qwen/Llama)并暴露 OpenAI 兼容 API 的实战:启动参数调优、量化模型加载、张量并行、压测与常见问题。
模型放不进单卡怎么办?张量并行、流水并行、ZeRO——本文精读 Megatron-LM、GPipe、DeepSpeed ZeRO 三篇,讲清大模型推理与训练的并行策略。
LLM 量化的三篇里程碑:LLM.int8() 首次让 175B 模型在单卡运行、GPTQ 把 4-bit 量化做到接近无损、AWQ 用激活感知保护重要权重。本文逐一精读并对比。
模型部署领域的论文地图:量化、蒸馏、压缩、推理服务系统、并行与分布式、LLM 推理——按主题分组列出代表性论文与一句话贡献,并指向本站精读页。
为什么部署工程师要读论文?本文说明论文精读模块的用法:读论文的方法(三遍法)、按主题的推荐阅读顺序,以及每篇精读页的入口。
推理服务系统的四篇关键论文:TensorFlow Serving 定义了模型服务范式,Clipper 提出模型选择与自适应批处理,Orca 的迭代级调度成为连续批处理前身,Nexus 把 GPU 分片做到极致。
论文太多读不完?本文给出三条论文阅读路径——新手入门(3 篇)、系统进阶(6 篇)、LLM 推理专题(4 篇),每条路径标注前置知识与阅读顺序。
蒸馏(knowledge distillation)用大模型教小模型,是部署场景中「用训练成本换推理成本」的核心手段。本文精读 Hinton KD 与 BERT 系蒸馏(DistilBERT、TinyBERT、MiniLM)。
vLLM 论文(SOSP 2023)是本领域必读:把操作系统虚拟内存分页的思想引入 KV Cache 管理,消除显存碎片,配合连续批处理让吞吐提升 2-4 倍。本文逐节精读。
部署翻车现场合集:训练/推理不一致、量化精度崩塌未发现、显存泄漏、无监控裸奔、一次性全量发布……每个坑都给出「症状→原因→解法」,全是血泪经验,附部署前 10 条自检清单。
用最小可用路径走通「训练→导出→服务→压测→监控」完整部署闭环:每一步给出可运行代码、仓库目录结构、常见坑与进阶方向,学完即拥有一套可复用的部署骨架。
模型发布与代码发布不同:效果要线上验证、出问题要能秒级回滚。本文讲清金丝雀、蓝绿、A/B 三种发布策略的对比与落地流程,以及发布前 checklist。
把推理服务接入 Prometheus + Grafana 的完整落地:自定义指标(请求数/延迟直方图/错误率)、GPU 指标采集、SLO 燃烧率告警规则与日志追踪,附上线后 30 天观察清单。
FastAPI、BentoML、Triton、KServe、SageMaker、火山方舟……部署技术栈怎么选?本文给出按团队规模、延迟要求、模型类型的选型决策框架与推荐矩阵。
模型上线前怎么瘦身提速?本文给出实操路线图:先量化(PTQ 起手)→ 精度不够再上 QAT/蒸馏 → 需要时剪枝,每步配工具与检查点,最后用一张决策表收尾。
上线前必须回答:能扛多少 QPS、P99 多少、要不要扩容。本文给出压测方法论:工具选型(wrk/locust/vegeta/ghz/k6)、场景设计、指标解读与容量计算公式。
部署工程师的简历最该突出什么?本文给出项目经验 STAR 写法、量化成果公式(延迟/QPS/成本/可用性)、关键词命中的策略,以及部署方向作品集项目的做法与反面教材。
部署方向面试高频题 80+:推理引擎原理、量化、服务化、K8s 与容器、监控、MLOps、LLM 推理、系统设计——每题附参考答案要点与追问方向,是你求职冲刺的终局题库。
模型部署领域有哪些岗位?ML 平台工程师、推理引擎工程师、MLOps 工程师、AI Infra 工程师各做什么、要求什么?本文给出岗位版图、职责对比与行业趋势,以及如何用本模块准备求职。
模型部署相关真实岗位长什么样?本文整理国内外 15+ 家公司在招的推理/MLOps/ML 平台岗位,逐条拆解核心要求,并标注薪资估计区间(供参考,非官方)。
JD 里的关键词(K8s、ONNX、TensorRT、vLLM、性能调优…)背后对应哪些知识体系?本文把高频 JD 关键词映射到本站知识点页面与掌握程度建议,让你知道该学什么、学到多深。
模型部署工具全景档案:推理引擎、服务框架、监控与实验管理、云平台、CI/CD——按用途分表列出定位、适用场景与上手难度,选型时对照查阅。
模型部署领域精选资源:官方文档、经典课程、高质量博客、社区与中文资源——按用途分类整理,附一句话评价,避免大海捞针。
模型部署领域核心术语表:基础概念、模型与格式、压缩与优化、服务与架构、硬件与性能、监控与运维、LLM 推理等 60+ 术语的准确定义与辨析。
模型部署工程师必备的系统知识速查:Linux、容器与 Docker、Kubernetes、网络与进程模型、GPU 环境与性能工具——部署排障时随手可查。