Skip to content

职业路径总览:模型部署岗位版图

本页速览 模型部署领域有哪些岗位?ML 平台工程师、推理引擎工程师、MLOps 工程师、AI Infra 工程师各做什么、要求什么?本文给出岗位版图、职责对比与行业趋势,以及如何用本模块准备求职。

职业路径总览:模型部署岗位版图

模型部署不再只是算法工程师的「收尾杂活」,而是一整条职业赛道:从写算子的推理引擎工程师,到管 GPU 集群的云原生 AI Infra 工程师,岗位五花八门,JD 里的关键词(TensorRT、K8s、vLLM、量化)又高度重叠。看懂了岗位版图,你就知道自己该往哪个方向投、简历该突出什么、面试该准备到什么深度。

本页是职业路径模块的导读:先给岗位版图,再逐个展开职责与面试点,最后给出「读 JD → 对知识地图 → 写简历 → 刷题库」的求职闭环。

先建立知识地基

如果你是第一次接触这个领域,建议先读 什么是模型部署 建立概念,再用本模块做求职规划。两条路径可以并行:本模块的学习路径里有 2 周求职冲刺路线,与这里的岗位地图互相咬合。

一、岗位版图总览

下表是当前(2025 年前后)市场上与模型部署强相关的五类岗位。同一家公司的同一岗位在不同部门可能叫法不同(「AI 平台工程师」「推理优化工程师」「MLOps 工程师」常被混用),核心判断标准是职责落在哪一层

岗位核心职责典型团队技能关键词
ML 平台工程师构建训练/推理统一平台:GPU 调度、实验管理、模型注册、服务编排大厂 AI 平台部、中台团队、云厂商K8s、Docker、GPU 调度、MLflow、KServe、CI/CD
推理引擎工程师优化推理引擎与算子,把单卡性能压到极限芯片厂商、云厂商 Infra、大厂推理组TensorRT、CUDA、Triton、ONNX、量化、性能剖析
MLOps 工程师打通「训练→上线→监控→回滚」全流程,管模型生命周期各行业 AI 团队、SaaS 厂商CI/CD、模型注册、监控告警、灰度发布、漂移检测
算法工程师(部署向)把训练好的模型落到线上并保证线上效果,做量化、服务化、性能调优业务算法组、推荐/搜索团队PyTorch、ONNX、量化、服务化、性能调优
云原生 AI Infra 工程师设计大规模 AI 基础设施:异构计算、网络、存储、多租户调度云厂商、大厂 Infra 部门K8s、RDMA、异构计算、资源调度、Serverless

一句话记忆:越往左越「平台与流程」,越往右越「硬件与算力」;算法工程师(部署向)是两者之间的黏合剂。

二、各岗位展开

1. ML 平台工程师(Machine Learning Platform Engineer)

  • 日常工作:搭建训练/推理平台,写 K8s operator 管理 GPU 资源;维护模型仓库(model registry)与实验跟踪系统;把模型上线流程模板化成「点一下 YAML 就部署」。
  • 关键技能:Kubernetes 调度原理、GPU 资源管理(device plugin、显存配额)、Docker 镜像工程、MLflow/KServe/BentoML 等平台组件;熟悉 MLOps 流水线部署模式
  • 典型面试点:Pod 生命周期、HPA 为什么对 GPU 推理不友好、如何实现模型热切换与回滚。见 面试题库·K8s 与容器

2. 推理引擎工程师(Inference Engine Engineer)

  • 日常工作:基于 TensorRT、ONNX Runtime、vLLM 等做二次开发;写 CUDA 算子或 kernel;做算子融合、INT8 量化、KV Cache 优化;用 profiler(nsight、torch.profiler)定位瓶颈。
  • 关键技能:CUDA 编程、TensorRT/Triton 工作流、量化理论(量化)、LLM 推理 的工程实现;性能剖析能力。
  • 典型面试点:TensorRT 的优化流程、算子融合为什么能提速、PagedAttention 的原理、prefill 与 decode 的差异。见 面试题库·推理引擎LLM 推理

3. MLOps 工程师

  • 日常工作:搭 CI/CD for ML 流水线(训练、评估、打包、上线);配置灰度/金丝雀发布与自动回滚;维护监控告警(延迟、吞吐、漂移);推动「模型训练与线上效果」对齐。
  • 关键技能:Docker/K8s 基本功、流水线工具(GitHub Actions、Argo Workflows、Jenkins)、Prometheus/Grafana、模型注册;理解 MLOps 流水线监控
  • 典型面试点:CI/CD for ML 与软件 CI/CD 的区别、推理灰度怎么判断好坏、漂移检测怎么做。见 面试题库·MLOps

4. 算法工程师(部署向)

  • 日常工作:负责自己训练模型的落地上线:转 ONNX、量化、调推理引擎参数;对接后端做服务化;持续跟踪线上指标(延迟、效果),必要时回炉重训。
  • 关键技能:PyTorch 训练基本功 + 部署工具链(ONNX、TensorRT、Triton、FastAPI);理解 推理基础服务化;性能调优与排障。
  • 典型面试点:PTH→ONNX→TensorRT 链路、量化精度验收、延迟构成分析。见 面试题库·推理基础推理引擎

5. 云原生 AI Infra 工程师

  • 日常工作:管几千张 GPU 的集群:网络(RDMA/InfiniBand)、存储、任务调度、多租户隔离;设计弹性伸缩与故障自愈;做 Serverless 推理平台。
  • 关键技能:K8s 深入(调度器、CRD、operator)、异构计算、网络与存储、容量规划;与 硬件基础系统原理 强相关。
  • 典型面试点:GPU 资源怎么调度与隔离、弹性伸缩怎么设计、故障自愈如何实现。见 面试题库·系统设计

三、行业趋势

趋势表现对求职者的影响
LLM 时代推理岗位爆发vLLM/Triton/推理优化工程师 JD 数量近两年翻倍,各厂都在抢懂大模型推理的人「LLM 推理」成为简历和面试的必答项;LLM 推理 相关知识必须补齐
AI Infra 成为独立方向云厂商与头部大厂纷纷把 AI Infra 单独成部门、设独立职级序列系统/网络背景的工程师有了新出口;纯业务算法岗 vs 基础架构岗的界线更清晰
推理成本成为关键指标推理成本占 AI 业务运营成本大头,量化、投机解码、稀疏化等降本手段被追捧面试会直接考「这个优化省了多少成本/多少卡」;性能优化量化 是高频考点
岗位技能融合平台、引擎、MLOps 的边界模糊,很多岗位要求「全栈部署」建议至少主攻一个方向,同时把相邻方向练到「能聊」的程度

两个反直觉的事实

第一,部署岗位比训练岗位更缺人——因为成本压力倒逼所有公司都要做推理优化;第二,「杂活」反而是好机会——很多资深部署工程师的起点,都是当年帮团队把模型弄上线的那个人。

四、不同规模公司的差异

维度大厂平台组 / 云厂商中型公司创业公司 / 外企小型团队
工作方式专人专岗,纵深1 个方向带横向全栈,「一个人顶一支队」
技术深度深:可能一年只打磨一个调度器中:平台 + 业务双肩挑广:从 GPU 到 API 到监控全碰
晋升路径职级体系完整,晋升看贡献靠项目说话靠结果说话,涨薪看融资
风险流程重、轮岗不确定平衡技术债多、但成长快
适合谁想做深度、要稳定体系想兼顾广度与深度想快速积累全栈经验、扛事

选择建议:应届/转行优先进「有老师带 + 有 GPU 可练手」的环境;手上有 2-3 年经验后,去创业公司或外企补全栈,再回头冲击大厂资深岗,是常见的三段式路径。

五、如何用本模块准备求职

本模块四个页面按求职漏斗排列:

顺序页面解决的问题用时建议
1JD 清单目标岗位长什么样?薪资区间多少?半天,圈出 5-8 个目标岗位
2知识点拆解JD 关键词背后要学什么、学到多深?1-2 天,产出个人学习清单
3简历怎么写简历怎么量化成果、怎么命中关键词?1 天,改 2-3 版
4面试题库高频题怎么答?系统设计怎么破?2 周,配合学习路径逐题攻克

别只看不练

简历里每一项「熟悉 K8s」「精通量化」都要能被 面试题库 里的追问击穿。建议顺序是:先刷题库自测,把答不出来的题标记出来,再回到对应的 概念页实践页 补课,形成闭环。

六、FAQ

没有 CUDA/内核经验,能投推理引擎岗吗?

能,但要从平台/MLOps 岗切入,把「推理」当作选修技能补齐。多数公司推理引擎岗分两级:引擎使用者(会调 TensorRT/vLLM、做量化)和引擎开发者(写算子),前者门槛低得多,也是很多人的实际入口。

算法出身,部署技能补到什么程度够用?

补到「能独立把模型上线且不翻车」:会转 ONNX/量化、会写服务、会压测、会看监控。方向性的深度(CUDA、K8s 调度)留给对应岗位。参考 动手构建你的第一个推理服务 的验收标准。

岗位名字都叫「AI Infra」,内容差很远,怎么判断?

看 JD 三要素:用什么语言(C++/CUDA → 引擎向;Go/Python → 平台向)、管什么资源(算子/显存 → 引擎向;GPU 集群/网络 → 基础设施向)、交付物是什么(性能报告 vs 平台/系统)。据此对照本页的岗位版图归类。

延伸阅读