---
name: yangge521/gpu-benchmark
source: https://app.decimal.ai/s/yangge521-gpu-benchmark@1/SKILL.md
source_sha256: d341c3a6ddcc
---

# GPU 性能基准测试

## 概述

提供 GPU 性能基准测试的完整方案，包括训练速度对比、推理延迟分解分析、极限 Batch Size 探测。基于 MTT S4000 (48GB) 与 NVIDIA T4 (16GB) 的真实对比测试数据。

## 使用场景

- GPU 选型评估：对比不同 GPU 的性价比
- 训练性能对比：评估不同 GPU 的训练吞吐
- 推理延迟瓶颈定位：分解各阶段耗时
- 最大 Batch Size 探测：确定最优批处理大小
- 跨 GPU 平台基准：建立性能基准线
- 驱动/固件升级验证：升级前后性能对比

## 真实测试数据

### 1. 训练速度对比（YOLO11n, 100 epochs, COCO128）

| GPU | 训练时间 | 平均 epoch | 显存占用 |
|-----|---------|-----------|---------|
| NVIDIA T4 (16GB) | 2.053h | 73.9s | 3.2GB |
| MTT S4000 (48GB) | 1.919h | 69.1s | 3.5GB |

S4000 训练速度比 T4 快约 7%

### 2. 推理延迟分解（YOLO11n, batch=1）

| 阶段 | NVIDIA T4 | MTT S4000 | 差异 |
|------|-----------|-----------|------|
| 前向推理 | 1.3ms | 1.2ms | S4000 略快 |
| 后处理 NMS | 0.9ms | 13.7ms | S4000 慢 15x |
| 总延迟 | 2.2ms | 14.9ms | T4 更快 |

S4000 后处理（NMS）耗时 13.7ms，是 T4 的 15 倍，为主要瓶颈

### 3. 极限 Batch Size 测试

| GPU | 显存 | 最大 Batch Size | OOM 临界点 |
|-----|------|----------------|-----------|
| NVIDIA T4 | 16GB | 32 | batch=33 OOM |
| MTT S4000 | 48GB | 544 | batch=545 OOM |

S4000 凭借 48GB 大显存，Batch Size 是 T4 的 17 倍

## 操作指南

### 1. 训练性能测试

使用 Ultralytics YOLO 框架标准训练：yolo11n.pt + COCO128 + 100 epochs。记录总训练时间和平均 epoch 时间。

### 2. 推理延迟分解测试

分别测量前向推理（model.model(images)）和后处理（non_max_suppression）。各重复 1000 次取平均值，预热 100 次。

### 3. 极限 Batch Size 探测

从 batch=1 开始翻倍增大直到 OOM，然后二分查找精确临界点。记录最大可用 Batch Size 和显存占用。

### 4. 性能对比报告

汇总训练时间、推理延迟、Batch Size 生成 Markdown 表格，重点分析差异指标。

## 优化建议

- S4000 后处理瓶颈：NMS 移至 CPU 或使用 TensorRT 优化
- T4 显存限制：使用梯度累积模拟大 Batch Size
- 混合精度训练：两卡均支持 FP16，可提升训练吞吐
- 批处理推理：利用大 Batch Size 提升总吞吐

## 常见问题与排查

| 问题 | 原因 | 解决方案 |
|------|------|---------|
| 训练结果不一致 | 随机种子未固定 | 设置 torch.manual_seed |
| 推理延迟波动大 | GPU 频率波动 | 固定 GPU 频率 |
| Batch Size 测试不准 | 碎片化显存 | 重启进程后测试 |
| 训练速度突然下降 | 散热降频 | 检查 GPU 温度 |
| S4000 NMS 极慢 | 算子实现 | 使用 CPU NMS |
| T4 OOM 过早 | 显存碎片 | torch.cuda.empty_cache |

## 扩展方向

- **多模型对比**: YOLO/DETR/RT-DETR 跨 GPU 对比
- **长时稳定性**: 24 小时持续推理性能衰减测试
- **能效比**: 性能/功耗比值评估
- **成本效益**: 性能/价格比值评估
- **自动基准**: CI/CD 集成自动性能回归测试
- **分布式训练**: 多卡 DDP 训练性能基准

## 技能链路

- **cross-platform-verify**: 跨平台权重验证配合性能对比
- **model-quantization**: 量化前后性能对比
- **perf-monitor**: 压测过程性能监控
- **gpu-concurrent**: 多卡并发性能测试
- **yolo-video-inference**: 实际推理场景性能

## 检查清单

- [ ] 训练测试使用相同数据集和超参
- [ ] 推理延迟测试预热 100 次
- [ ] Batch Size 测试记录 OOM 临界点
- [ ] GPU 温度和频率稳定后开始测试
- [ ] 对比报告包含差异分析
- [ ] 测试结果可复现