---
name: yangge521/cloud-deploy-cn
source: https://app.decimal.ai/s/yangge521-cloud-deploy-cn@1/SKILL.md
source_sha256: eaf707fab53f
---

# 云服务器部署指南

## 概述

提供主流云平台（阿里云、腾讯云、AWS）的部署指南，包含 GPU 实例选型、环境配置、CI/CD 自动化流程。

## 使用场景

- GPU 推理服务上云：从本地部署迁移到云 GPU
- 弹性伸缩：根据流量自动增减 GPU 实例
- 多区域部署：不同区域部署推理服务降低延迟
- 灾备方案：主备云服务器故障切换
- GPU 实例选型：对比不同云平台 GPU 性价比
- 混合云部署：本地 GPU + 云 GPU 混合调度

## 操作指南

### 1. GPU 云实例选型

| 平台 | 实例类型 | GPU | 显存 | 适用场景 | 参考价格 |
|------|---------|-----|------|---------|---------|
| 阿里云 | GN10X | V100 | 16GB | 深度学习训练 | ~15元/小时 |
| 阿里云 | GN7 | T4 | 16GB | 推理/轻量训练 | ~5元/小时 |
| 腾讯云 | GN10X | V100 | 16GB | 训练 | ~14元/小时 |
| AWS | p3.2xlarge | V100 | 16GB | 训练 | ~$3.06/小时 |
| AWS | g4dn.xlarge | T4 | 16GB | 推理 | ~$0.526/小时 |

### 2. GPU 服务器环境初始化

安装 NVIDIA 驱动（nvidia-driver-535），安装 Docker 和 NVIDIA Container Toolkit，验证 nvidia-smi 和 Docker GPU 访问。

### 3. 推理服务部署

使用 docker run --gpus all -e CUDA_VISIBLE_DEVICES=0 -p 8000:8000 部署，挂载模型和数据目录，配置 --restart unless-stopped。

### 4. Nginx 反向代理 + SSL

安装 Nginx 和 Certbot，配置反向代理指向推理服务，certbot --nginx 自动 SSL。

### 5. CI/CD 自动化部署

GitHub Actions 在 push main 时触发：构建 Docker 镜像、传输到服务器、停旧容器、启新容器。

### 6. 安全加固

禁止 root SSH、禁用密码认证、UFW 防火墙仅开放 22/80/443/1935 端口。

## 常见问题与排查

| 问题 | 原因 | 解决方案 |
|------|------|---------|
| GPU 实例创建失败 | 配额不足 | 申请提升 GPU 配额 |
| Docker GPU 不可用 | Toolkit 未安装 | 安装 nvidia-container-toolkit |
| 推理服务外网不可达 | 安全组未放行 | 配置安全组规则 |
| SSL 证书申请失败 | 80 端口未放行 | 检查安全组 80 端口 |
| SSH 连接超时 | 防火墙限制 | 检查安全组 22 端口 |
| 磁盘空间不足 | 模型文件过大 | 挂载数据盘 |

## 扩展方向

- **Serverless GPU**: AWS Lambda GPU / 阿里云函数计算 GPU
- **Spot 实例**: 使用竞价实例降低成本
- **GPU 集群**: K8s + GPU device plugin 集群管理
- **多云部署**: 跨云平台负载分发
- **自动化运维**: Ansible/Terraform 基础设施即代码
- **监控告警**: 云平台 CloudWatch/云监控集成

## 技能链路

- **docker-deploy**: 容器化推理服务部署
- **nginx-config**: Nginx 反向代理配置
- **ssl-manager**: SSL 证书管理
- **ci-cd-cn**: CI/CD 自动化部署流水线
- **gpu-concurrent**: 多 GPU 实例并发管理

## 检查清单

- [ ] GPU 驱动安装并验证
- [ ] Docker + NVIDIA Container Toolkit 已配置
- [ ] 推理服务容器化部署
- [ ] Nginx 反向代理已配置
- [ ] SSL 证书已部署
- [ ] 防火墙规则已设置
- [ ] CI/CD 流水线已配置