在华为云服务器(ECS)上进行深度学习开发,通常不需要像本地那样从零安装所有基础工具,但为了构建高效、稳定的深度学习环境,建议按以下层次安装和配置依赖工具。
✅ 推荐路径:使用官方镜像 → 配置 GPU 驱动 → 安装 CUDA/cuDNN → 配置 Python 虚拟环境 → 安装深度学习框架
一、系统级依赖(操作系统层)
1. 选择合适的基础镜像
- 推荐镜像:
- Ubuntu 20.04 / 22.04 LTS(最常用,社区支持好)
- CentOS 7/8 或 EulerOS(华为云默认,但需额外配置)
- 华为云提供“深度学习专用镜像”(如 PyTorch/TensorFlow 预装版),可大幅简化流程
2. 更新系统与基础工具
sudo apt update && sudo apt upgrade -y
sudo apt install -y
build-essential
git
curl
wget
vim
htop
tmux
unzip
zip
cmake
libgl1-mesa-glx
libglib2.0-0
libsm6
libxext6
libxrender-dev
二、GPU 驱动与 CUDA 工具包(关键!)
⚠️ 若使用华为云提供的“深度学习镜像”,此步骤可能已预装,但仍建议验证版本兼容性。
1. 安装 NVIDIA 显卡驱动
# 查看当前驱动状态
nvidia-smi
# 若未安装,可通过以下方式之一:
# 方式1:通过 Ubuntu 仓库安装(简单但不一定是最新版)
sudo ubuntu-drivers autoinstall
# 方式2:从 NVIDIA 官网下载.run 文件安装(推荐用于最新驱动)
wget https://us.download.nvidia.com/XFree86/Linux-x86_64/<DRIVER_VERSION>.run
sudo bash <DRIVER_VERSION>.run
2. 安装 CUDA Toolkit
根据你使用的深度学习框架要求选择 CUDA 版本(例如 PyTorch 1.13+ 推荐 CUDA 11.7)
# 以 CUDA 11.7 为例(Ubuntu 20.04)
wget https://developer.download.nvidia.com/compute/cuda/11.7.0/local_installers/cuda_11.7.0_515.43.04_linux.run
sudo sh cuda_11.7.0_515.43.04_linux.run
📌 注意:安装时选择仅安装
CUDA Toolkit,不要重复安装驱动(如果已装好驱动)。
3. 安装 cuDNN
从 NVIDIA cuDNN 官网 下载对应 CUDA 版本的 cuDNN,解压并复制到 CUDA 目录:
tar -xzvf cudnn-linux-x86_64-<version>-cuda11.x.tar.gz
sudo cp cudnn-*-include/*.h /usr/local/cuda/include
sudo cp cudnn-*-lib/libcudnn* /usr/local/cuda/lib64
sudo chmod a+r /usr/local/cuda/include/cudnn*.h /usr/local/cuda/lib64/libcudnn*
4. 设置环境变量
编辑 ~/.bashrc 添加:
export PATH=/usr/local/cuda/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH
source ~/.bashrc
验证:
nvcc --version
nvidia-smi
三、Python 环境与包管理
1. 安装 Python(推荐 3.8–3.10)
sudo apt install -y python3.9 python3.9-venv python3.9-dev
2. 创建虚拟环境(强烈推荐使用 conda 或 venv)
选项 A:使用 Conda(推荐,便于管理复杂依赖)
# 下载 Miniconda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh
# 初始化
conda init bash
source ~/.bashrc
# 创建环境
conda create -n dl_env python=3.9
conda activate dl_env
选项 B:使用 venv
python3.9 -m venv ~/dl_env
source ~/dl_env/bin/activate
四、深度学习框架安装
1. PyTorch(推荐)
访问 PyTorch 官网 获取对应 CUDA 版本的安装命令。
示例(CUDA 11.7 + pip):
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117
2. TensorFlow
pip install tensorflow[and-cuda] # TF 2.11+ 自动匹配 CUDA
# 或指定版本
pip install tensorflow==2.11.0
3. 其他常用库
pip install numpy pandas scikit-learn matplotlib seaborn pillow opencv-python-headless
pip install tqdm ipython jupyterlab
pip install wandb mlflow # 实验跟踪
五、可选增强工具
| 工具 | 用途 |
|---|---|
tensorboard |
可视化训练过程 |
horovod / deepspeed |
分布式训练 |
flash-attn |
提速 Transformer 推理 |
nccl-tests |
测试多卡通信性能 |
docker + nvidia-docker |
容器化部署(生产环境推荐) |
六、验证环境是否就绪
import torch
print(torch.__version__)
print(torch.cuda.is_available()) # 应输出 True
print(torch.version.cuda) # 显示 CUDA 版本
print(torch.backends.cudnn.version()) # 显示 cuDNN 版本
import tensorflow as tf
print(tf.__version__)
print("GPU Available:", tf.config.list_physical_devices('GPU'))
✅ 最佳实践建议
- 优先使用华为云“深度学习镜像”:节省大量手动配置时间。
- 固定 CUDA/cuDNN/框架版本组合:避免兼容性问题。
- 使用 Conda 管理环境:隔离不同项目依赖。
- 定期备份模型与数据:利用 OBS 对象存储做持久化。
- 监控资源使用:用
htop,nvidia-smi,watch -n 1 nvidia-smi实时监控。
如需具体某框架(如 PyTorch 分布式训练、TensorFlow 多卡并行)的详细配置,可进一步说明需求。
CLOUD技术笔记