Install any skill in seconds. Free to start, no credit card required.
Get Started Free →模型量化加速方案,涵盖 FP16 半精度、INT8 量化、TensorRT/ONNX Runtime 部署优化
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | 2% | 0% |
| case-10 | ✗→✓ | ▲ Improved | 29% | 0% |
| case-14 | ✗→✓ | ▲ Improved | -5% | 0% |
| case-18 | ✗→✓ | ▲ Improved | -11% | 0% |
| case-03 | ✓→✓ | = Same ✓ | 19% | 0% |
提供模型量化加速的完整方案,包括 FP16 半精度推理、INT8 量化、TensorRT 引擎转换、ONNX Runtime 部署优化。在保证精度的前提下最大化推理吞吐。
pythonfrom ultralytics import YOLO model = YOLO("yolo11n.pt") results = model.predict(source="video.mp4", half=True, device=0)
FP16 将显存占用减半,推理速度提升 30-50%,精度损失通常小于 0.5%。NVIDIA T4 和 MTT S4000 均原生支持。
训练后量化(PTQ):使用校准数据集统计激活分布,将 FP32 权重和激活量化为 INT8。量化感知训练(QAT):在训练中模拟量化误差,精度更高但需重新训练。INT8 可将模型体积减小 4 倍,推理速度提升 2-3 倍。
pythonfrom ultralytics import YOLO model = YOLO("yolo11n.pt") model.export(format="onnx", half=True, simplify=True) model.export(format="engine", half=True, workspace=4)
TensorRT 针对特定 GPU 架构优化,融合层操作,推理速度比 PyTorch 快 2-5 倍。注意引擎不可跨 GPU 型号使用。
pythonimport onnxruntime as ort session = ort.InferenceSession("yolo11n.onnx", providers=["CUDAExecutionProvider", "CPUExecutionProvider"]) outputs = session.run(None, {"images": input_tensor})
ONNX Runtime 提供跨平台推理加速,支持 CUDA/MUSA/CPU 后端,适合跨 GPU 平台部署。
| 方案 | 精度损失 | 加速比 | 显存节省 | 适用场景 | |------|---------|--------|---------|---------| | FP32 基准 | 0% | 1x | 0% | 精度敏感 | | FP16 | 小于0.5% | 1.3-1.5x | 50% | 通用加速 | | INT8 PTQ | 1-3% | 2-3x | 75% | 高吞吐 | | INT8 QAT | 小于1% | 2-3x | 75% | 精度速度兼顾 | | TensorRT | 小于1% | 2-5x | 50% | NVIDIA 极致 |
| 问题 | 原因 | 解决方案 | |------|------|---------| | 量化后 mAP 下降明显 | 校准数据不足 | 增加校准集多样性 | | TensorRT 引擎不可用 | GPU 型号不匹配 | 在目标 GPU 上重新导出 | | ONNX 推理结果不一致 | 算子版本差异 | 检查 opset 版本 | | FP16 精度损失大 | 数值范围溢出 | 检查异常激活值 | | INT8 推理反而变慢 | 硬件不支持 | 确认 GPU 支持 INT8 | | 模型导出失败 | 框架版本旧 | 升级 Ultralytics |
Other measured skills in the registry, with their headline benchmark lift.