外观
工具档案
怎么用
按「用途」定位到对应表格,对照「一句话定位 / 适用场景 / 上手难度 / 开源」判断是否合适。上手难度用 ★(★☆☆ 低、★★☆ 中、★★★ 高)。选型没有万能答案:先明确你的约束(硬件、延迟、团队规模、是否自建),再看每张表后的选型提示。更完整的横向对比见 框架与平台怎么选。
时效性提醒
开源工具迭代极快,部分项目状态可能变化(本表已标注 2026 年已知的维护状态)。选型前建议核对官方仓库的活动状态。
推理引擎
| 工具 | 一句话定位 | 适用场景 | 上手难度 | 开源 | 官方入口 |
|---|---|---|---|---|---|
| ONNX Runtime | 跨平台通用推理运行时 | 从 CPU 到 GPU 的全场景通用部署、快速落地 | ★☆☆ | ✅(MIT) | https://onnxruntime.ai/ |
| TensorRT | NVIDIA 高性能推理编译器 | NVIDIA GPU 上榨干性能,延迟与吞吐极端敏感 | ★★★ | 部分开源 | https://developer.nvidia.com/tensorrt |
| OpenVINO | Intel 全系硬件推理工具链 | Intel CPU/GPU/NPU,边缘与 AI PC | ★★☆ | ✅ | https://docs.openvino.ai/ |
| TFLite(LiteRT) | 移动/嵌入式轻量推理 | Android/iOS/MCU 端侧部署 | ★★☆ | ✅ | https://www.tensorflow.org/lite |
| llama.cpp | C/C++ 本地 LLM 推理 + GGUF | CPU/Apple Silicon/低显存跑大模型 | ★★☆ | ✅(MIT) | https://github.com/ggml-org/llama.cpp |
| vLLM | 高性能 LLM 服务引擎 | 大模型在线/批量推理,PagedAttention + 连续批处理 | ★★☆ | ✅ | https://docs.vllm.ai/en/latest/ |
| TGI | Hugging Face 的 LLM 服务端 | 已进入维护模式,新项目建议用 vLLM/SGLang | ★★☆ | ✅ | https://github.com/huggingface/text-generation-inference |
| SGLang | 高性能 LLM/多模态服务框架 | 追求低延迟与高吞吐的 LLM 服务,RadixAttention 前缀复用 | ★★★ | ✅ | https://docs.sglang.ai/ |
选型提示:非 NVIDIA 或「先跑通再说」选 ONNX Runtime;NVIDIA 上要极致性能选 TensorRT(LLM 则 vLLM/SGLang);本地/端侧跑模型选 llama.cpp / TFLite;新 LLM 服务直接 vLLM,多模态或极限吞吐再评估 SGLang。
服务框架
| 工具 | 一句话定位 | 适用场景 | 上手难度 | 开源 | 官方入口 |
|---|---|---|---|---|---|
| FastAPI | Python 通用 API 框架 | 自研推理服务的 HTTP 层,灵活度最高 | ★☆☆ | ✅(MIT) | https://fastapi.tiangolo.com/ |
| TorchServe | PyTorch 官方模型服务 | 纯 PyTorch 生态、想要官方支持;注意官方已标注 Limited Maintenance | ★★☆ | ✅ | https://pytorch.org/serve/ |
| Triton Inference Server | 多框架生产级推理服务器 | 多模型/多框架混布、动态批处理、GPU 利用率要求高 | ★★★ | ✅(BSD-3) | https://github.com/triton-inference-server/server |
| KServe | Kubernetes 推理平台 | 已有 K8s,要声明式部署 + 自动扩缩 + 金丝雀 | ★★★ | ✅ | https://kserve.github.io/website/ |
| BentoML | Python 原生推理服务框架 | 快速打包部署、可观测性内置、从 notebook 到生产 | ★★☆ | ✅ | https://www.bentoml.com/ |
| Ray Serve | 可编程分布式服务 | 多模型组合、跨机扩展、与 Ray 生态集成 | ★★★ | ✅ | https://docs.ray.io/en/latest/serve/ |
| Seldon Core | K8s 上的 MLOps 服务框架 | 模型治理、实验路由(A/B、影子)、大规模模型管理 | ★★★ | 部分(BSL) | https://github.com/SeldonIO/seldon-core |
选型提示:快速上线、团队小选 FastAPI 或 BentoML;K8s 原生、要治理能力选 KServe;多框架多模型 + 极致 GPU 利用选 Triton;多模型组合编排看 Ray Serve。
监控与实验管理
| 工具 | 一句话定位 | 适用场景 | 上手难度 | 开源 | 官方入口 |
|---|---|---|---|---|---|
| Prometheus | 指标采集与时序数据库 | 服务/系统指标监控,K8s 环境事实标准 | ★★☆ | ✅ | https://prometheus.io/ |
| Grafana | 可视化仪表盘 | 把 Prometheus 等数据源变成可看的监控面板 | ★☆☆ | ✅ | https://grafana.com/ |
| MLflow | 实验跟踪 + 模型注册 | 训练实验管理、模型版本与注册、部署衔接 | ★★☆ | ✅(Apache-2.0) | https://mlflow.org/ |
| Evidently | 数据漂移与模型质量监控 | 预测类模型与 LLM 的漂移检测、测试套件 | ★★☆ | ✅(Apache-2.0) | https://www.evidentlyai.com/ |
| WhyLabs / whylogs / LangKit | AI 可观测性 | 公司已停止运营,平台已开源(whylogs、LangKit 等可自托管) | ★★☆ | ✅ | https://github.com/whylabs/langkit |
| OpenTelemetry | 遥测标准(Trace/Metric/Log) | 统一接入各类后端,跨服务链路追踪 | ★★☆ | ✅ | https://opentelemetry.io/ |
选型提示:起步组合 = Prometheus + Grafana(指标)+ OpenTelemetry(链路)+ 业务层选 Evidently 做模型质量监控;实验与模型管理从 MLflow 开始,团队成熟后再引入注册与治理流程。
云平台
| 平台 | 一句话定位 | 适用场景 | 上手难度 | 备注 |
|---|---|---|---|---|
| AWS SageMaker | AWS 全托管 ML 平台 | 已在 AWS 上、要端到端训练/部署/推理 | ★★★ | https://aws.amazon.com/sagemaker/ |
| Azure Machine Learning | 微软全托管 ML 平台 | 企业合规与 Azure 生态 | ★★★ | https://azure.microsoft.com/products/machine-learning/ |
| Google Vertex AI | Google 全托管 ML 平台 | GCP 生态、与 Google 基础设施深度集成 | ★★★ | https://cloud.google.com/vertex-ai |
| 火山方舟(火山引擎) | 字节跳动的大模型服务平台 | 国内大模型 API 与推理服务 | ★★☆ | https://www.volcengine.com/product/ark |
| 阿里云 PAI | 阿里云 AI 开发与推理平台 | 国内云上训练/推理一体化 | ★★☆ | https://www.aliyun.com/product/pai |
| 百度 BML | 百度全功能 AI 开发平台 | 飞桨生态、国内私有化/公有云部署 | ★★☆ | https://cloud.baidu.com/product/bml |
选型提示:跟云走——已经在哪朵云上就优先用哪家的托管平台(成本与集成最优);国内业务与中文模型优先评估火山方舟、阿里云 PAI、百度 BML;想避免锁定再回来自建(KServe/BentoML)。
CI/CD 与管道
| 工具 | 一句话定位 | 适用场景 | 上手难度 | 开源 | 官方入口 |
|---|---|---|---|---|---|
| GitHub Actions | GitHub 内置 CI/CD | 训练→测试→构建镜像→推送的标准流水线 | ★☆☆ | 免费额度 | https://docs.github.com/en/actions |
| ArgoCD | GitOps 持续交付(K8s) | 用 Git 管理部署状态,自动同步到集群 | ★★☆ | ✅ | https://argoproj.github.io/cd/ |
| Tekton | K8s 原生 CI/CD | 云原生、可移植的流水线 | ★★★ | ✅ | https://tekton.dev/ |
| Kubeflow | K8s 上的 ML 平台 | 训练/流水线/模型注册/部署全套 | ★★★ | ✅ | https://www.kubeflow.org/ |
| Airflow | 工作流编排(DAG) | 批处理推理、定时评估、数据管道 | ★★☆ | ✅ | https://airflow.apache.org/ |
| Prefect | Python 原生编排 | 现代 Python 团队、更轻量的批处理编排 | ★★☆ | ✅ | https://www.prefect.io/ |
选型提示:模型流水线:GitHub Actions 构建 + ArgoCD 做 GitOps 部署是最快组合;批处理推理与定时评估:从 Airflow 或 Prefect 起步;要完整 ML 平台再上 Kubeflow(较重)。
选型决策速查
| 你的约束 | 建议组合 |
|---|---|
| 只想尽快上线一个模型 API | FastAPI 或 BentoML + ONNX Runtime,Docker 部署 |
| NVIDIA GPU + 多模型 + 高吞吐 | Triton(+ TensorRT 引擎),KServe 上 K8s |
| 大模型在线服务 | vLLM(或 SGLang),配 Prometheus/Grafana + 前缀缓存 |
| 移动/嵌入式 | TFLite 或 OpenVINO,配合量化 |
| 已有 K8s、要治理与发布 | KServe / Seldon Core + ArgoCD |
| 云端托管省事 | 按云厂商选 SageMaker / Azure ML / Vertex AI / 火山方舟 / PAI |