← 返回总览

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 4,051Fork: 628语言: Python协议: Apache-2.0今日 +22GitHub ↗

深度介绍

它是什么

NVIDIA Model-Optimizer 是 NVIDIA 官方推出的统一模型优化库,集成了量化、蒸馏、剪枝、神经架构搜索、投机解码等 SOTA 技术,专为下游部署框架(TensorRT-LLM、TensorRT、vLLM 等)压缩深度学习模型、加速推理而生。

核心亮点

一站式覆盖主流压缩手段,无需在多个工具间切换;与 NVIDIA 自家推理栈深度打通,压缩后的模型可直接落地部署;Apache-2.0 许可,商用友好。

为什么火

大模型推理成本高企,量化与投机解码是降本增效的关键路径。背靠 NVIDIA 生态,天然适配 TensorRT-LLM 与 vLLM,开发者能低成本拿到生产级加速效果,4k+ Star 印证了社区对官方方案的信任。

适合谁用

需要部署大模型、追求推理吞吐与显存优化的工程团队;使用 TensorRT-LLM 或 vLLM 的开发者;研究模型压缩与加速方向的研究者。

快速上手

pip install nvidia-modelopt

参考官方示例,选择量化或投机解码流程,导出后接入 TensorRT-LLM / vLLM 即可。