外观
JD 知识点拆解:关键词背后的知识体系
JD 里最唬人的不是「3 年经验」,而是那一串名词:K8s、TensorRT、vLLM、INT8 量化、动态批处理、容量规划…… 每个词背后都是一套知识体系,且需要掌握的深度完全不同——有的要求「了解即可」,有的要求「能手写公式、能现场推导」。
本页把高频 JD 关键词映射到本站对应知识点页面,给出掌握深度建议与面试常见追问,让你知道该学什么、学到多深,避免「对着 K8s 啃三个月却只是了解」的投入错配。
深度定义
了解 = 能一句话说出是什么、解决什么问题;熟练 = 能上手配置/使用,能讲清关键参数;精通 = 能讲原理、能调优、能回答反例与边界。
一、总体映射表
按「JD 关键词 → 本站页面 → 建议深度 → 面试追问方向」组织,先看全貌,再按分组精读。
| JD 关键词 | 本站对应页面 | 建议深度 | 面试常见追问 |
|---|---|---|---|
| Kubernetes | 部署模式 | 熟练 | Pod 生命周期、HPA 原理 |
| Docker | 推理系统总体架构解剖 | 熟练 | 镜像分层、资源限制 |
| ONNX / ONNX Runtime | 模型格式 | 熟练 | PTH 转 ONNX 的坑、EP 是什么 |
| TensorRT | 模型格式 | 熟练 | 优化流程、INT8 校准 |
| Triton | 模型服务、Triton 案例 | 熟练 | 动态批处理、模型并发实例 |
| vLLM | LLM 推理、vLLM 案例 | 熟练 | PagedAttention、连续批处理 |
| MLflow | MLOps 流水线 | 了解 | 模型注册、实验跟踪 |
| 量化 | 量化 | 精通(区分度高) | PTQ/QAT、INT8 精度、GPTQ/AWQ |
| 模型压缩 | 模型压缩 | 了解 | 剪枝/蒸馏/稀疏化区别 |
| 推理优化 | 性能优化、推理基础 | 精通 | 瓶颈定位方法、带宽受限 |
| 动态批处理 | 模型服务 | 熟练 | 延迟与吞吐权衡 |
| KV Cache | LLM 推理 | 熟练 | 显存估算、长上下文 |
| 性能调优 | 性能优化、压测方法 | 熟练 | 如何定位 P99 变差 |
| 容量规划 | 压测方法 | 熟练 | 峰值 QPS 与卡数估算 |
| 监控告警 | 监控、可观测性实践 | 熟练 | SLO、告警设计、漂移检测 |
| CI/CD | MLOps 流水线 | 熟练 | ML CI/CD 与软件 CI/CD 差异 |
| 灰度发布 | 上线流程 | 熟练 | 灰度如何判断好坏、回滚 |
| GPU/显存 | 硬件基础 | 熟练 | 显存带宽、为什么推理受限 |
| 安全 | 安全 | 了解 | 模型窃取、越权、审计 |
| 术语/工具总览 | 术语表、工具盘点 | 随查 | —— |
二、分组精读
1. 框架与工具组
| 关键词 | 核心要点 | 建议深度 | 本站页面 |
|---|---|---|---|
| K8s | 声明式编排、Pod/Deployment/Service/HPA、GPU 调度 | 熟练:能画调度链路 | 部署模式 |
| Docker | 镜像、容器隔离、GPU 透传(--gpus) | 熟练 | 推理系统总体架构解剖 |
| ONNX Runtime | 图优化、算子融合、EP 机制、量化支持 | 熟练 | 模型格式 |
| TensorRT | parse→build→engine、INT8 校准、与硬件绑定 | 熟练(引擎岗精通) | 模型格式、TensorRT 边缘案例 |
| Triton | 多框架、动态批处理、并发实例、ensemble | 熟练 | 模型服务、Triton 案例 |
| vLLM | PagedAttention、连续批处理、量化加载 | 熟练(LLM 岗精通) | LLM 推理、vLLM 案例 |
| MLflow | 实验跟踪、模型注册、阶段管理 | 了解 | MLOps 流水线 |
工具太多记不住?
先用 工具盘点 建立「每个工具在链路中占哪个位置」的地图,再对目标岗位的 2-3 个核心工具做深度练习。面试官考的不是背参数,而是**「为什么在这里用它」**。
2. 领域知识组
| 关键词 | 核心要点 | 建议深度 | 本站页面 |
|---|---|---|---|
| 量化(PTQ/QAT) | scale/zero_point、校准、精度验收 | 精通 | 量化 |
| 模型压缩 | 剪枝、蒸馏、稀疏化、知识迁移 | 了解 | 模型压缩 |
| 推理优化 | 算子融合、内核选择、CUDA Graph | 精通 | 推理基础、性能优化 |
| 动态批处理 | 请求聚合、超时触发、延迟代价 | 熟练 | 模型服务 |
| KV Cache | 自回归缓存、显存占用、分页 | 熟练 | LLM 推理 |
3. 工程能力组
| 关键词 | 核心要点 | 建议深度 | 本站页面 |
|---|---|---|---|
| 性能调优 | profiling 流程、P99 分析、瓶颈分类 | 熟练 | 性能优化 |
| 容量规划 | 压测建模、QPS→卡数换算、预留水位 | 熟练 | 压测方法 |
| 监控告警 | 黄金指标、SLO、漂移检测 | 熟练 | 监控、可观测性实践 |
| CI/CD | 训练/评估/部署流水线、模型注册 | 熟练 | MLOps 流水线 |
| 灰度发布 | 金丝雀、蓝绿、自动回滚 | 熟练 | 上线流程 |
4. 软技能组
| 关键词 | 核心要点 | 建议深度 | 本站页面 |
|---|---|---|---|
| 跨团队协作 | 与算法/后端/SRE 的接口、需求翻译 | 了解 | 推理系统总体架构解剖 |
| 文档 | 部署手册、runbook、事故复盘 | 了解 | 可观测性实践 |
软技能别裸奔
面试问「你和算法团队怎么协作」时,答案是具体工作流:谁提供模型→谁负责服务化→效果谁验收→线上问题怎么升级。本站 上线流程 的职责边界就是一个很好的回答模板。
三、用本站学习路径串联
单页学习效率低,建议按 学习路径:三条路线 串联:
- 求职冲刺(2 周):把上面「建议深度=熟练」的条目按路线图扫一遍,重点保证「能答能写」。
- 系统精进(8 周):对「建议深度=精通」的量化、推理优化做深度攻坚,配合 动手构建 出成果。
- 案头速查(常驻):把「了解」级别的内容记成关键词索引,随用随查 术语表 与 工具盘点。
四、自评清单:10 道题自测当前水平
答得出「是什么 + 为什么 + 怎么做」为 ✅;只会背定义,追问就卡住为 ⚠️;完全没概念为 ❌。自测后把 ❌ 和 ⚠️ 反向映射回上表对应页面补课。
| # | 自测题 | 对应页面 | 掌握判定 |
|---|---|---|---|
| 1 | 推理为什么比训练更适合量化? | 推理基础 | □ |
| 2 | PTH 模型转 ONNX 再转 TensorRT,中间各步解决什么问题? | 模型格式 | □ |
| 3 | INT8 量化后精度掉 3 个点,你按什么顺序排查? | 量化 | □ |
| 4 | 一个推理服务 P99 从 60ms 涨到 200ms,怎么定位? | 性能优化 | □ |
| 5 | 动态批处理把 QPS 翻倍了,延迟为什么反而升高? | 模型服务 | □ |
| 6 | 70B 模型 FP16 需要多大显存?KV Cache 怎么算? | LLM 推理 | □ |
| 7 | HPA 为什么对 GPU 推理服务不够用? | 部署模式 | □ |
| 8 | 怎么给一个推理服务设计 SLO 与告警? | 监控 | □ |
| 9 | 灰度上线一个模型,怎么判断新模型「行不行」? | 上线流程 | □ |
| 10 | 同一份数据,训练时预处理和服务时预处理不一致,会发生什么? | MLOps 流水线 | □ |
完成自测后,把 ❌/⚠️ 的题目拿到 模型部署面试题 里找对应的参考答案,再用 简历怎么写 把补课成果写进简历。
延伸阅读
- JD 清单:国内外公司在招岗位 —— 关键词的原始出处
- 职业路径总览:岗位版图 —— 判断自己该主攻哪个方向
- 模型部署面试题 —— 自测的终局题库
- 学习路径:三条路线 —— 把本页清单变成每周计划
- 概念页总入口 —— 所有概念页的地基
- 工具盘点 —— 工具层面的速查手册