Skip to content

工具档案

本页速览 模型部署工具全景档案:推理引擎、服务框架、监控与实验管理、云平台、CI/CD——按用途分表列出定位、适用场景与上手难度,选型时对照查阅。

工具档案

怎么用

按「用途」定位到对应表格,对照「一句话定位 / 适用场景 / 上手难度 / 开源」判断是否合适。上手难度用 ★(★☆☆ 低、★★☆ 中、★★★ 高)。选型没有万能答案:先明确你的约束(硬件、延迟、团队规模、是否自建),再看每张表后的选型提示。更完整的横向对比见 框架与平台怎么选

时效性提醒

开源工具迭代极快,部分项目状态可能变化(本表已标注 2026 年已知的维护状态)。选型前建议核对官方仓库的活动状态。

推理引擎

工具一句话定位适用场景上手难度开源官方入口
ONNX Runtime跨平台通用推理运行时从 CPU 到 GPU 的全场景通用部署、快速落地★☆☆✅(MIT)https://onnxruntime.ai/
TensorRTNVIDIA 高性能推理编译器NVIDIA GPU 上榨干性能,延迟与吞吐极端敏感★★★部分开源https://developer.nvidia.com/tensorrt
OpenVINOIntel 全系硬件推理工具链Intel CPU/GPU/NPU,边缘与 AI PC★★☆https://docs.openvino.ai/
TFLite(LiteRT)移动/嵌入式轻量推理Android/iOS/MCU 端侧部署★★☆https://www.tensorflow.org/lite
llama.cppC/C++ 本地 LLM 推理 + GGUFCPU/Apple Silicon/低显存跑大模型★★☆✅(MIT)https://github.com/ggml-org/llama.cpp
vLLM高性能 LLM 服务引擎大模型在线/批量推理,PagedAttention + 连续批处理★★☆https://docs.vllm.ai/en/latest/
TGIHugging Face 的 LLM 服务端已进入维护模式,新项目建议用 vLLM/SGLang★★☆https://github.com/huggingface/text-generation-inference
SGLang高性能 LLM/多模态服务框架追求低延迟与高吞吐的 LLM 服务,RadixAttention 前缀复用★★★https://docs.sglang.ai/

选型提示:非 NVIDIA 或「先跑通再说」选 ONNX Runtime;NVIDIA 上要极致性能选 TensorRT(LLM 则 vLLM/SGLang);本地/端侧跑模型选 llama.cpp / TFLite;新 LLM 服务直接 vLLM,多模态或极限吞吐再评估 SGLang。

服务框架

工具一句话定位适用场景上手难度开源官方入口
FastAPIPython 通用 API 框架自研推理服务的 HTTP 层,灵活度最高★☆☆✅(MIT)https://fastapi.tiangolo.com/
TorchServePyTorch 官方模型服务纯 PyTorch 生态、想要官方支持;注意官方已标注 Limited Maintenance★★☆https://pytorch.org/serve/
Triton Inference Server多框架生产级推理服务器多模型/多框架混布、动态批处理、GPU 利用率要求高★★★✅(BSD-3)https://github.com/triton-inference-server/server
KServeKubernetes 推理平台已有 K8s,要声明式部署 + 自动扩缩 + 金丝雀★★★https://kserve.github.io/website/
BentoMLPython 原生推理服务框架快速打包部署、可观测性内置、从 notebook 到生产★★☆https://www.bentoml.com/
Ray Serve可编程分布式服务多模型组合、跨机扩展、与 Ray 生态集成★★★https://docs.ray.io/en/latest/serve/
Seldon CoreK8s 上的 MLOps 服务框架模型治理、实验路由(A/B、影子)、大规模模型管理★★★部分(BSL)https://github.com/SeldonIO/seldon-core

选型提示快速上线、团队小选 FastAPI 或 BentoML;K8s 原生、要治理能力选 KServe;多框架多模型 + 极致 GPU 利用选 Triton;多模型组合编排看 Ray Serve。

监控与实验管理

工具一句话定位适用场景上手难度开源官方入口
Prometheus指标采集与时序数据库服务/系统指标监控,K8s 环境事实标准★★☆https://prometheus.io/
Grafana可视化仪表盘把 Prometheus 等数据源变成可看的监控面板★☆☆https://grafana.com/
MLflow实验跟踪 + 模型注册训练实验管理、模型版本与注册、部署衔接★★☆✅(Apache-2.0)https://mlflow.org/
Evidently数据漂移与模型质量监控预测类模型与 LLM 的漂移检测、测试套件★★☆✅(Apache-2.0)https://www.evidentlyai.com/
WhyLabs / whylogs / LangKitAI 可观测性公司已停止运营,平台已开源(whylogs、LangKit 等可自托管)★★☆https://github.com/whylabs/langkit
OpenTelemetry遥测标准(Trace/Metric/Log)统一接入各类后端,跨服务链路追踪★★☆https://opentelemetry.io/

选型提示:起步组合 = Prometheus + Grafana(指标)+ OpenTelemetry(链路)+ 业务层选 Evidently 做模型质量监控;实验与模型管理从 MLflow 开始,团队成熟后再引入注册与治理流程。

云平台

平台一句话定位适用场景上手难度备注
AWS SageMakerAWS 全托管 ML 平台已在 AWS 上、要端到端训练/部署/推理★★★https://aws.amazon.com/sagemaker/
Azure Machine Learning微软全托管 ML 平台企业合规与 Azure 生态★★★https://azure.microsoft.com/products/machine-learning/
Google Vertex AIGoogle 全托管 ML 平台GCP 生态、与 Google 基础设施深度集成★★★https://cloud.google.com/vertex-ai
火山方舟(火山引擎)字节跳动的大模型服务平台国内大模型 API 与推理服务★★☆https://www.volcengine.com/product/ark
阿里云 PAI阿里云 AI 开发与推理平台国内云上训练/推理一体化★★☆https://www.aliyun.com/product/pai
百度 BML百度全功能 AI 开发平台飞桨生态、国内私有化/公有云部署★★☆https://cloud.baidu.com/product/bml

选型提示:跟云走——已经在哪朵云上就优先用哪家的托管平台(成本与集成最优);国内业务与中文模型优先评估火山方舟、阿里云 PAI、百度 BML;想避免锁定再回来自建(KServe/BentoML)。

CI/CD 与管道

工具一句话定位适用场景上手难度开源官方入口
GitHub ActionsGitHub 内置 CI/CD训练→测试→构建镜像→推送的标准流水线★☆☆免费额度https://docs.github.com/en/actions
ArgoCDGitOps 持续交付(K8s)用 Git 管理部署状态,自动同步到集群★★☆https://argoproj.github.io/cd/
TektonK8s 原生 CI/CD云原生、可移植的流水线★★★https://tekton.dev/
KubeflowK8s 上的 ML 平台训练/流水线/模型注册/部署全套★★★https://www.kubeflow.org/
Airflow工作流编排(DAG)批处理推理、定时评估、数据管道★★☆https://airflow.apache.org/
PrefectPython 原生编排现代 Python 团队、更轻量的批处理编排★★☆https://www.prefect.io/

选型提示模型流水线:GitHub Actions 构建 + ArgoCD 做 GitOps 部署是最快组合;批处理推理与定时评估:从 Airflow 或 Prefect 起步;要完整 ML 平台再上 Kubeflow(较重)。

选型决策速查

你的约束建议组合
只想尽快上线一个模型 APIFastAPI 或 BentoML + ONNX Runtime,Docker 部署
NVIDIA GPU + 多模型 + 高吞吐Triton(+ TensorRT 引擎),KServe 上 K8s
大模型在线服务vLLM(或 SGLang),配 Prometheus/Grafana + 前缀缓存
移动/嵌入式TFLite 或 OpenVINO,配合量化
已有 K8s、要治理与发布KServe / Seldon Core + ArgoCD
云端托管省事按云厂商选 SageMaker / Azure ML / Vertex AI / 火山方舟 / PAI

延伸阅读