Skip to content

JD 知识点拆解:关键词背后的知识体系

本页速览 JD 里的关键词(K8s、ONNX、TensorRT、vLLM、性能调优…)背后对应哪些知识体系?本文把高频 JD 关键词映射到本站知识点页面与掌握程度建议,让你知道该学什么、学到多深。

JD 知识点拆解:关键词背后的知识体系

JD 里最唬人的不是「3 年经验」,而是那一串名词:K8sTensorRTvLLMINT8 量化动态批处理容量规划…… 每个词背后都是一套知识体系,且需要掌握的深度完全不同——有的要求「了解即可」,有的要求「能手写公式、能现场推导」。

本页把高频 JD 关键词映射到本站对应知识点页面,给出掌握深度建议面试常见追问,让你知道该学什么、学到多深,避免「对着 K8s 啃三个月却只是了解」的投入错配。

深度定义

了解 = 能一句话说出是什么、解决什么问题;熟练 = 能上手配置/使用,能讲清关键参数;精通 = 能讲原理、能调优、能回答反例与边界。

一、总体映射表

按「JD 关键词 → 本站页面 → 建议深度 → 面试追问方向」组织,先看全貌,再按分组精读。

JD 关键词本站对应页面建议深度面试常见追问
Kubernetes部署模式熟练Pod 生命周期、HPA 原理
Docker推理系统总体架构解剖熟练镜像分层、资源限制
ONNX / ONNX Runtime模型格式熟练PTH 转 ONNX 的坑、EP 是什么
TensorRT模型格式熟练优化流程、INT8 校准
Triton模型服务Triton 案例熟练动态批处理、模型并发实例
vLLMLLM 推理vLLM 案例熟练PagedAttention、连续批处理
MLflowMLOps 流水线了解模型注册、实验跟踪
量化量化精通(区分度高)PTQ/QAT、INT8 精度、GPTQ/AWQ
模型压缩模型压缩了解剪枝/蒸馏/稀疏化区别
推理优化性能优化推理基础精通瓶颈定位方法、带宽受限
动态批处理模型服务熟练延迟与吞吐权衡
KV CacheLLM 推理熟练显存估算、长上下文
性能调优性能优化压测方法熟练如何定位 P99 变差
容量规划压测方法熟练峰值 QPS 与卡数估算
监控告警监控可观测性实践熟练SLO、告警设计、漂移检测
CI/CDMLOps 流水线熟练ML CI/CD 与软件 CI/CD 差异
灰度发布上线流程熟练灰度如何判断好坏、回滚
GPU/显存硬件基础熟练显存带宽、为什么推理受限
安全安全了解模型窃取、越权、审计
术语/工具总览术语表工具盘点随查——

二、分组精读

1. 框架与工具组

关键词核心要点建议深度本站页面
K8s声明式编排、Pod/Deployment/Service/HPA、GPU 调度熟练:能画调度链路部署模式
Docker镜像、容器隔离、GPU 透传(--gpus熟练推理系统总体架构解剖
ONNX Runtime图优化、算子融合、EP 机制、量化支持熟练模型格式
TensorRTparse→build→engine、INT8 校准、与硬件绑定熟练(引擎岗精通)模型格式TensorRT 边缘案例
Triton多框架、动态批处理、并发实例、ensemble熟练模型服务Triton 案例
vLLMPagedAttention、连续批处理、量化加载熟练(LLM 岗精通)LLM 推理vLLM 案例
MLflow实验跟踪、模型注册、阶段管理了解MLOps 流水线

工具太多记不住?

先用 工具盘点 建立「每个工具在链路中占哪个位置」的地图,再对目标岗位的 2-3 个核心工具做深度练习。面试官考的不是背参数,而是**「为什么在这里用它」**。

2. 领域知识组

关键词核心要点建议深度本站页面
量化(PTQ/QAT)scale/zero_point、校准、精度验收精通量化
模型压缩剪枝、蒸馏、稀疏化、知识迁移了解模型压缩
推理优化算子融合、内核选择、CUDA Graph精通推理基础性能优化
动态批处理请求聚合、超时触发、延迟代价熟练模型服务
KV Cache自回归缓存、显存占用、分页熟练LLM 推理

3. 工程能力组

关键词核心要点建议深度本站页面
性能调优profiling 流程、P99 分析、瓶颈分类熟练性能优化
容量规划压测建模、QPS→卡数换算、预留水位熟练压测方法
监控告警黄金指标、SLO、漂移检测熟练监控可观测性实践
CI/CD训练/评估/部署流水线、模型注册熟练MLOps 流水线
灰度发布金丝雀、蓝绿、自动回滚熟练上线流程

4. 软技能组

关键词核心要点建议深度本站页面
跨团队协作与算法/后端/SRE 的接口、需求翻译了解推理系统总体架构解剖
文档部署手册、runbook、事故复盘了解可观测性实践

软技能别裸奔

面试问「你和算法团队怎么协作」时,答案是具体工作流:谁提供模型→谁负责服务化→效果谁验收→线上问题怎么升级。本站 上线流程 的职责边界就是一个很好的回答模板。

三、用本站学习路径串联

单页学习效率低,建议按 学习路径:三条路线 串联:

  1. 求职冲刺(2 周):把上面「建议深度=熟练」的条目按路线图扫一遍,重点保证「能答能写」。
  2. 系统精进(8 周):对「建议深度=精通」的量化、推理优化做深度攻坚,配合 动手构建 出成果。
  3. 案头速查(常驻):把「了解」级别的内容记成关键词索引,随用随查 术语表工具盘点

四、自评清单:10 道题自测当前水平

答得出「是什么 + 为什么 + 怎么做」为 ✅;只会背定义,追问就卡住为 ⚠️;完全没概念为 ❌。自测后把 ❌ 和 ⚠️ 反向映射回上表对应页面补课。

#自测题对应页面掌握判定
1推理为什么比训练更适合量化?推理基础
2PTH 模型转 ONNX 再转 TensorRT,中间各步解决什么问题?模型格式
3INT8 量化后精度掉 3 个点,你按什么顺序排查?量化
4一个推理服务 P99 从 60ms 涨到 200ms,怎么定位?性能优化
5动态批处理把 QPS 翻倍了,延迟为什么反而升高?模型服务
670B 模型 FP16 需要多大显存?KV Cache 怎么算?LLM 推理
7HPA 为什么对 GPU 推理服务不够用?部署模式
8怎么给一个推理服务设计 SLO 与告警?监控
9灰度上线一个模型,怎么判断新模型「行不行」?上线流程
10同一份数据,训练时预处理和服务时预处理不一致,会发生什么?MLOps 流水线

完成自测后,把 ❌/⚠️ 的题目拿到 模型部署面试题 里找对应的参考答案,再用 简历怎么写 把补课成果写进简历。

延伸阅读