使用华为云服务器进行深度学习需要安装哪些依赖工具?

在华为云服务器(ECS)上进行深度学习开发,通常不需要像本地那样从零安装所有基础工具,但为了构建高效、稳定的深度学习环境,建议按以下层次安装和配置依赖工具。

✅ 推荐路径:使用官方镜像 → 配置 GPU 驱动 → 安装 CUDA/cuDNN → 配置 Python 虚拟环境 → 安装深度学习框架


一、系统级依赖(操作系统层)

1. 选择合适的基础镜像

  • 推荐镜像:
    • Ubuntu 20.04 / 22.04 LTS(最常用,社区支持好)
    • CentOS 7/8 或 EulerOS(华为云默认,但需额外配置)
    • 华为云提供“深度学习专用镜像”(如 PyTorch/TensorFlow 预装版),可大幅简化流程

2. 更新系统与基础工具

sudo apt update && sudo apt upgrade -y
sudo apt install -y 
    build-essential 
    git 
    curl 
    wget 
    vim 
    htop 
    tmux 
    unzip 
    zip 
    cmake 
    libgl1-mesa-glx 
    libglib2.0-0 
    libsm6 
    libxext6 
    libxrender-dev

二、GPU 驱动与 CUDA 工具包(关键!)

⚠️ 若使用华为云提供的“深度学习镜像”,此步骤可能已预装,但仍建议验证版本兼容性。

1. 安装 NVIDIA 显卡驱动

# 查看当前驱动状态
nvidia-smi

# 若未安装,可通过以下方式之一:
# 方式1:通过 Ubuntu 仓库安装(简单但不一定是最新版)
sudo ubuntu-drivers autoinstall

# 方式2:从 NVIDIA 官网下载.run 文件安装(推荐用于最新驱动)
wget https://us.download.nvidia.com/XFree86/Linux-x86_64/<DRIVER_VERSION>.run
sudo bash <DRIVER_VERSION>.run

2. 安装 CUDA Toolkit

根据你使用的深度学习框架要求选择 CUDA 版本(例如 PyTorch 1.13+ 推荐 CUDA 11.7)

# 以 CUDA 11.7 为例(Ubuntu 20.04)
wget https://developer.download.nvidia.com/compute/cuda/11.7.0/local_installers/cuda_11.7.0_515.43.04_linux.run
sudo sh cuda_11.7.0_515.43.04_linux.run

📌 注意:安装时选择仅安装 CUDA Toolkit,不要重复安装驱动(如果已装好驱动)。

3. 安装 cuDNN

从 NVIDIA cuDNN 官网 下载对应 CUDA 版本的 cuDNN,解压并复制到 CUDA 目录:

tar -xzvf cudnn-linux-x86_64-<version>-cuda11.x.tar.gz
sudo cp cudnn-*-include/*.h /usr/local/cuda/include
sudo cp cudnn-*-lib/libcudnn* /usr/local/cuda/lib64
sudo chmod a+r /usr/local/cuda/include/cudnn*.h /usr/local/cuda/lib64/libcudnn*

4. 设置环境变量

编辑 ~/.bashrc 添加:

export PATH=/usr/local/cuda/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH
source ~/.bashrc

验证:

nvcc --version
nvidia-smi

三、Python 环境与包管理

1. 安装 Python(推荐 3.8–3.10)

sudo apt install -y python3.9 python3.9-venv python3.9-dev

2. 创建虚拟环境(强烈推荐使用 conda 或 venv)

选项 A:使用 Conda(推荐,便于管理复杂依赖)

# 下载 Miniconda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh

# 初始化
conda init bash
source ~/.bashrc

# 创建环境
conda create -n dl_env python=3.9
conda activate dl_env

选项 B:使用 venv

python3.9 -m venv ~/dl_env
source ~/dl_env/bin/activate

四、深度学习框架安装

1. PyTorch(推荐)

访问 PyTorch 官网 获取对应 CUDA 版本的安装命令。

示例(CUDA 11.7 + pip):

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117

2. TensorFlow

pip install tensorflow[and-cuda]   # TF 2.11+ 自动匹配 CUDA
# 或指定版本
pip install tensorflow==2.11.0

3. 其他常用库

pip install numpy pandas scikit-learn matplotlib seaborn pillow opencv-python-headless
pip install tqdm ipython jupyterlab
pip install wandb mlflow  # 实验跟踪

五、可选增强工具

工具 用途
tensorboard 可视化训练过程
horovod / deepspeed 分布式训练
flash-attn 提速 Transformer 推理
nccl-tests 测试多卡通信性能
docker + nvidia-docker 容器化部署(生产环境推荐)

六、验证环境是否就绪

import torch
print(torch.__version__)
print(torch.cuda.is_available())        # 应输出 True
print(torch.version.cuda)               # 显示 CUDA 版本
print(torch.backends.cudnn.version())   # 显示 cuDNN 版本
import tensorflow as tf
print(tf.__version__)
print("GPU Available:", tf.config.list_physical_devices('GPU'))

✅ 最佳实践建议

  1. 优先使用华为云“深度学习镜像”:节省大量手动配置时间。
  2. 固定 CUDA/cuDNN/框架版本组合:避免兼容性问题。
  3. 使用 Conda 管理环境:隔离不同项目依赖。
  4. 定期备份模型与数据:利用 OBS 对象存储做持久化。
  5. 监控资源使用:用 htop, nvidia-smi, watch -n 1 nvidia-smi 实时监控。

如需具体某框架(如 PyTorch 分布式训练、TensorFlow 多卡并行)的详细配置,可进一步说明需求。

云服务器