Install any skill in seconds. Free to start, no credit card required.
Get Started Free →多 GPU 并发推理管理,支持 CUDA_VISIBLE_DEVICES/MUSA_VISIBLE_DEVICES 环境变量隔离与进程管理
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-11 | ✗→✓ | ▲ Improved | -29% | 0% |
| case-14 | ✗→✓ | ▲ Improved | 91% | 0% |
| case-15 | ✗→✓ | ▲ Improved | 5% | 0% |
| case-16 | ✗→✓ | ▲ Improved | -46% | 0% |
| case-03 | ✓→✓ | = Same ✓ | 47% | 0% |
管理多 GPU 环境下的并发推理任务,通过环境变量隔离 GPU 资源,实现每张 GPU 独立运行推理进程。已在 8x MTT S4000 集群上验证。
| 测试模式 | 总 FPS | 达标路数 | 状态 | |---------|--------|---------|------| | 8卡 x 1路 | 374.84 | 16/16 | 全部达标 | | 8卡 x 2路 | 493.15 | 12/16 | 4路未达标 |
NVIDIA 使用 CUDA_VISIBLE_DEVICES=0,1 指定 GPU。摩尔线程使用 MUSA_VISIBLE_DEVICES=0,1。在启动推理进程前设置环境变量。
使用 subprocess.Popen 启动独立进程,每个进程通过 env 参数绑定特定 GPU。按 NUM_GPUS x ROUTES_PER_GPU 计算总路数。
Docker 环境通过 devices 映射 /dev/dri/renderD128 实现隔离,配合环境变量指定 GPU。
NVIDIA 使用 nvidia-smi --query-gpu 查询利用率和显存。摩尔线程使用 mthreads-gmi。每 5 秒采集一次。
维护异常 GPU 列表,分配时自动跳过。检查 GPU 利用率(大于95%跳过)和显存使用率(大于90%跳过)。
pythonGPU_CONFIG = { "nvidia": {"ids": [0, 1], "env_key": "CUDA_VISIBLE_DEVICES"}, "mthreads": {"ids": [2, 3, 4, 5, 6, 7], "env_key": "MUSA_VISIBLE_DEVICES"}, }
按 GPU 类型分配任务,不同类型 GPU 使用不同框架后端。
| 问题 | 原因 | 解决方案 | |------|------|---------| | 进程绑定 GPU 失败 | 环境变量未生效 | 确认 env 传递正确 | | GPU 显存不释放 | 进程僵尸 | kill -9 强制终止 | | 某些 GPU 性能低 | 散热/驱动问题 | 标记为异常跳过 | | Docker 内 GPU 不可见 | 设备未映射 | 映射 render 节点 | | 多进程 GPU 冲突 | 未做隔离 | 使用环境变量隔离 | | 混合 GPU 不兼容 | 框架差异 | 按类型分组调度 |
Other measured skills in the registry, with their headline benchmark lift.