Skip to content

精选资源清单

本页速览 模型部署领域精选资源:官方文档、经典课程、高质量博客、社区与中文资源——按用途分类整理,附一句话评价,避免大海捞针。

精选资源清单

怎么用这份清单

按分类检索,每条附「一句话评价」帮你判断值不值得点进去。链接会变动,如果某条打不开,去项目官方 GitHub 或官网首页找最新入口。结尾附「新人先看这 5 个」起步清单。

官方文档与工具站

名称链接一句话评价
ONNX 官网https://onnx.ai/开放模型交换格式的规范与生态入口,转换模型的起点。
ONNX Runtimehttps://onnxruntime.ai/微软出品的跨平台推理引擎,CPU/GPU/NPU 全支持,入门部署的首选运行时。
NVIDIA TensorRThttps://developer.nvidia.com/tensorrtNVIDIA 高性能推理编译器的官方主页,含文档、下载与 GTC 资料。
Triton Inference Serverhttps://github.com/triton-inference-server/server多框架、多模型、多 GPU 的生产级推理服务器,动态批处理与并发执行标杆。
vLLM 文档https://docs.vllm.ai/en/latest/大模型推理的事实标准引擎,PagedAttention + 连续批处理的开山之作。
KServehttps://kserve.github.io/website/Kubernetes 上的标准推理平台,把「部署模型」声明式地变成 YAML。
BentoMLhttps://www.bentoml.com/面向推理的 Python 原生服务框架,打包、部署、可观测一站式。
MLflowhttps://mlflow.org/实验跟踪 + 模型注册的行业标准,从训练到注册再到部署的桥梁。
Hugging Face Inference Endpointshttps://huggingface.co/docs/inference-endpoints/index在 HF Hub 上托管模型为 API 的托管服务,几行配置就能上线。
llama.cpphttps://github.com/ggml-org/llama.cppC/C++ 实现、支持 GGUF 量化,本地/CPU/Apple Silicon 跑大模型的万能钥匙。
OpenVINOhttps://docs.openvino.ai/Intel 全系硬件(CPU/GPU/NPU)的推理工具链,边缘与 AI PC 场景利器。
TensorFlow Litehttps://www.tensorflow.org/lite移动端与嵌入式推理的官方方案,配套模型转换与量化工具。
FastAPIhttps://fastapi.tiangolo.com/Python 上最流行的 API 框架,模型服务的 HTTP 层几乎都是它。
PyTorchhttps://pytorch.org/训练框架事实标准,TorchServe/ExecuTorch 等部署工具从这出发。
Text Generation Inference(TGI)https://github.com/huggingface/text-generation-inferenceHF 出品的高性能 LLM 服务端,已进入维护模式(官方建议新项目用 vLLM/SGLang)。

系统课程

名称链接一句话评价
MIT 6.5940 TinyML and Efficient Deep Learning Computinghttps://hanlab.mit.edu/courses/2024-fall-65940高效深度学习圣经级课程:剪枝、量化、蒸馏、LLM 部署全覆盖,含 lab 与作业。
Stanford CS 329S Machine Learning Systems Designhttps://stanford-cs329s.github.io/机器学习系统设计课程,从需求分析到上线监控的完整方法论,配套书《Designing ML Systems》。
MLOps Zoomcamp(DataTalks.Club)https://github.com/DataTalksClub/mlops-zoomcamp免费 9 周 MLOps 实战课:实验跟踪、部署、监控、CI/CD 一条龙。
Full Stack Deep Learninghttps://fullstackdeeplearning.com/从训练到部署再到监控的全栈深度学习课程,含 LLM Bootcamp,免费公开。

经典论文入口

名称链接一句话评价
本手册·论文精读栏目/papers/vllm-paper/papers/quantization-papers站内精读:PagedAttention 与 GPTQ/AWQ 等量化经典,附中文解读。
arXivhttps://arxiv.org/论文的第一手来源,用关键词(LLM inference / quantization / serving)订阅最新研究。

读论文的建议

先读本手册的论文精读建立框架,再回 arXiv 追原文。注意:arXiv 预印本未经同行评审,落地前交叉核对实现(如 vLLM、llama.cpp 的代码)。

高质量博客

名称链接一句话评价
NVIDIA 技术博客https://developer.nvidia.com/blogTensorRT/Triton/GPU 性能的官方技术深挖,量化系列与推理优化值得精读。
vLLM 博客https://blog.vllm.aiLLM 推理系统工程化的第一手资料:PagedAttention、连续批处理、投机解码原理。
Hugging Face 博客https://huggingface.co/blog模型、库与生态更新的大本营,也常见高质量的系统与评测文章。
BentoML 博客https://www.bentoml.com/blog推理部署实战向,含 LLM 推理性能对比与最佳实践。
Databricks 博客https://www.databricks.com/blogMLOps/数据工程视角的长文质量极高,理解「生产级机器学习」必看。
Anyscale 博客https://www.anyscale.com/blogRay 生态官方博客,分布式推理与 Ray Serve 的实战经验丰富。

社区

名称链接一句话评价
Reddit r/MachineLearninghttps://www.reddit.com/r/MachineLearning/全球最大 ML 社区,论文发布与业内讨论的第一现场。
Hacker Newshttps://news.ycombinator.com/技术新闻与高信噪比评论,新框架发布常常从这里扩散。
awesome-production-machine-learninghttps://github.com/EthicalML/awesome-production-machine-learning20k+ star 的生产级 ML 工具大全(⚠️ 列表可能过时,条目需自行核实)。
Hugging Face 模型库https://huggingface.co/模型、数据集、Space 与文档一体化,LLM 时代的默认起点。

中文资源

个人选择

以下为作者个人偏好,仅作参考,不代表全站立场。公众号没有稳定链接,请在微信内搜索对应名称。

名称链接一句话评价
知乎「模型部署 / 大模型推理优化」话题https://www.zhihu.com/在站内搜索「模型部署」「LLM 推理优化」「MLOps」,有大量一线工程师的踩坑长文。
机器之心https://www.jiqizhixin.com/中文 AI 行业与工程报道头部媒体,大模型部署案例覆盖广。
量子位https://www.qbitai.com/AI 资讯更新快,产业动态与开源模型进展消息灵通。
微信公众号:NVIDIA 英伟达中国、Datawhale、开源中国 等微信内搜索Datawhale 等社区持续产出中文系列教程(如 LLM 推理、MLOps),适合系统入门。

新人先看这 5 个

  1. 先读本手册术语表 + 什么是模型部署,建立 30 分钟的概念地图。
  2. vLLM 博客https://blog.vllm.ai):从《PagedAttention 与连续批处理》一文读懂大模型推理为什么快。
  3. ONNX Runtime 官方快速上手https://onnxruntime.ai/):用最流行的运行时跑通「导出 → 转换 → 推理」最小闭环。
  4. MIT 6.5940 课程https://hanlab.mit.edu/courses/2024-fall-65940):系统补齐量化、剪枝、蒸馏的知识底座。
  5. NVIDIA 技术博客的推理性能专题https://developer.nvidia.com/blog):把「性能」从玄学变成可度量、可优化的工程问题。

延伸阅读