外观
精选资源清单
怎么用这份清单
按分类检索,每条附「一句话评价」帮你判断值不值得点进去。链接会变动,如果某条打不开,去项目官方 GitHub 或官网首页找最新入口。结尾附「新人先看这 5 个」起步清单。
官方文档与工具站
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| ONNX 官网 | https://onnx.ai/ | 开放模型交换格式的规范与生态入口,转换模型的起点。 |
| ONNX Runtime | https://onnxruntime.ai/ | 微软出品的跨平台推理引擎,CPU/GPU/NPU 全支持,入门部署的首选运行时。 |
| NVIDIA TensorRT | https://developer.nvidia.com/tensorrt | NVIDIA 高性能推理编译器的官方主页,含文档、下载与 GTC 资料。 |
| Triton Inference Server | https://github.com/triton-inference-server/server | 多框架、多模型、多 GPU 的生产级推理服务器,动态批处理与并发执行标杆。 |
| vLLM 文档 | https://docs.vllm.ai/en/latest/ | 大模型推理的事实标准引擎,PagedAttention + 连续批处理的开山之作。 |
| KServe | https://kserve.github.io/website/ | Kubernetes 上的标准推理平台,把「部署模型」声明式地变成 YAML。 |
| BentoML | https://www.bentoml.com/ | 面向推理的 Python 原生服务框架,打包、部署、可观测一站式。 |
| MLflow | https://mlflow.org/ | 实验跟踪 + 模型注册的行业标准,从训练到注册再到部署的桥梁。 |
| Hugging Face Inference Endpoints | https://huggingface.co/docs/inference-endpoints/index | 在 HF Hub 上托管模型为 API 的托管服务,几行配置就能上线。 |
| llama.cpp | https://github.com/ggml-org/llama.cpp | C/C++ 实现、支持 GGUF 量化,本地/CPU/Apple Silicon 跑大模型的万能钥匙。 |
| OpenVINO | https://docs.openvino.ai/ | Intel 全系硬件(CPU/GPU/NPU)的推理工具链,边缘与 AI PC 场景利器。 |
| TensorFlow Lite | https://www.tensorflow.org/lite | 移动端与嵌入式推理的官方方案,配套模型转换与量化工具。 |
| FastAPI | https://fastapi.tiangolo.com/ | Python 上最流行的 API 框架,模型服务的 HTTP 层几乎都是它。 |
| PyTorch | https://pytorch.org/ | 训练框架事实标准,TorchServe/ExecuTorch 等部署工具从这出发。 |
| Text Generation Inference(TGI) | https://github.com/huggingface/text-generation-inference | HF 出品的高性能 LLM 服务端,已进入维护模式(官方建议新项目用 vLLM/SGLang)。 |
系统课程
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| MIT 6.5940 TinyML and Efficient Deep Learning Computing | https://hanlab.mit.edu/courses/2024-fall-65940 | 高效深度学习圣经级课程:剪枝、量化、蒸馏、LLM 部署全覆盖,含 lab 与作业。 |
| Stanford CS 329S Machine Learning Systems Design | https://stanford-cs329s.github.io/ | 机器学习系统设计课程,从需求分析到上线监控的完整方法论,配套书《Designing ML Systems》。 |
| MLOps Zoomcamp(DataTalks.Club) | https://github.com/DataTalksClub/mlops-zoomcamp | 免费 9 周 MLOps 实战课:实验跟踪、部署、监控、CI/CD 一条龙。 |
| Full Stack Deep Learning | https://fullstackdeeplearning.com/ | 从训练到部署再到监控的全栈深度学习课程,含 LLM Bootcamp,免费公开。 |
经典论文入口
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| 本手册·论文精读栏目 | /papers/vllm-paper 与 /papers/quantization-papers | 站内精读:PagedAttention 与 GPTQ/AWQ 等量化经典,附中文解读。 |
| arXiv | https://arxiv.org/ | 论文的第一手来源,用关键词(LLM inference / quantization / serving)订阅最新研究。 |
读论文的建议
先读本手册的论文精读建立框架,再回 arXiv 追原文。注意:arXiv 预印本未经同行评审,落地前交叉核对实现(如 vLLM、llama.cpp 的代码)。
高质量博客
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| NVIDIA 技术博客 | https://developer.nvidia.com/blog | TensorRT/Triton/GPU 性能的官方技术深挖,量化系列与推理优化值得精读。 |
| vLLM 博客 | https://blog.vllm.ai | LLM 推理系统工程化的第一手资料:PagedAttention、连续批处理、投机解码原理。 |
| Hugging Face 博客 | https://huggingface.co/blog | 模型、库与生态更新的大本营,也常见高质量的系统与评测文章。 |
| BentoML 博客 | https://www.bentoml.com/blog | 推理部署实战向,含 LLM 推理性能对比与最佳实践。 |
| Databricks 博客 | https://www.databricks.com/blog | MLOps/数据工程视角的长文质量极高,理解「生产级机器学习」必看。 |
| Anyscale 博客 | https://www.anyscale.com/blog | Ray 生态官方博客,分布式推理与 Ray Serve 的实战经验丰富。 |
社区
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| Reddit r/MachineLearning | https://www.reddit.com/r/MachineLearning/ | 全球最大 ML 社区,论文发布与业内讨论的第一现场。 |
| Hacker News | https://news.ycombinator.com/ | 技术新闻与高信噪比评论,新框架发布常常从这里扩散。 |
| awesome-production-machine-learning | https://github.com/EthicalML/awesome-production-machine-learning | 20k+ star 的生产级 ML 工具大全(⚠️ 列表可能过时,条目需自行核实)。 |
| Hugging Face 模型库 | https://huggingface.co/ | 模型、数据集、Space 与文档一体化,LLM 时代的默认起点。 |
中文资源
个人选择
以下为作者个人偏好,仅作参考,不代表全站立场。公众号没有稳定链接,请在微信内搜索对应名称。
| 名称 | 链接 | 一句话评价 |
|---|---|---|
| 知乎「模型部署 / 大模型推理优化」话题 | https://www.zhihu.com/ | 在站内搜索「模型部署」「LLM 推理优化」「MLOps」,有大量一线工程师的踩坑长文。 |
| 机器之心 | https://www.jiqizhixin.com/ | 中文 AI 行业与工程报道头部媒体,大模型部署案例覆盖广。 |
| 量子位 | https://www.qbitai.com/ | AI 资讯更新快,产业动态与开源模型进展消息灵通。 |
| 微信公众号:NVIDIA 英伟达中国、Datawhale、开源中国 等 | 微信内搜索 | Datawhale 等社区持续产出中文系列教程(如 LLM 推理、MLOps),适合系统入门。 |
新人先看这 5 个
- 先读本手册:术语表 + 什么是模型部署,建立 30 分钟的概念地图。
- vLLM 博客(https://blog.vllm.ai):从《PagedAttention 与连续批处理》一文读懂大模型推理为什么快。
- ONNX Runtime 官方快速上手(https://onnxruntime.ai/):用最流行的运行时跑通「导出 → 转换 → 推理」最小闭环。
- MIT 6.5940 课程(https://hanlab.mit.edu/courses/2024-fall-65940):系统补齐量化、剪枝、蒸馏的知识底座。
- NVIDIA 技术博客的推理性能专题(https://developer.nvidia.com/blog):把「性能」从玄学变成可度量、可优化的工程问题。