对于本地服务器部署深度学习框架,推荐使用 Ubuntu 22.04 LTS(Jammy Jellyfish),原因如下:
推荐版本:Ubuntu 22.04 LTS
-
长期支持(LTS)
- 官方支持至 2027年4月(主流支持),安全更新至 2032年4月。
- 适合服务器环境,无需频繁升级系统。
-
软件生态兼容性
- 预装 Python 3.10,兼容主流深度学习框架(PyTorch、TensorFlow、JAX等)。
- 官方APT源提供较新的CUDA Toolkit、NVIDIA驱动等关键依赖。
-
硬件与驱动支持
- 内核版本(5.15+)对新一代GPU(如NVIDIA RTX 30/40系列)支持更好。
- 通过
ubuntu-drivers工具可便捷安装NVIDIA驱动。
-
容器与虚拟化
- 默认集成现代容器工具(如Docker、Podman),方便部署隔离环境。
备选版本:Ubuntu 20.04 LTS
- 适用场景:
- 现有环境已稳定运行20.04,且无升级必要。
- 依赖旧版库(如Python 3.8)或特定旧版CUDA(如CUDA 10.x)。
- 注意:主流支持已结束(2025年4月),需确保安全更新机制正常。
部署建议
-
系统安装
- 选择 Minimal Installation(最小化安装),减少不必要的软件包。
- 分区时预留足够空间给数据集和模型存储。
-
驱动与CUDA
# 安装NVIDIA驱动(推荐使用专有驱动) sudo ubuntu-drivers autoinstall # 或指定版本(如CUDA所需) sudo apt install nvidia-driver-535 # 通过官方源安装CUDA Toolkit(以CUDA 12.x为例) wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb sudo dpkg -i cuda-keyring_1.1-1_all.deb sudo apt update sudo apt install cuda-toolkit-12-4 -
环境隔离
- 使用 Conda 或 Python虚拟环境 管理依赖:
# 安装Miniconda wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh bash Miniconda3-latest-Linux-x86_64.sh
创建独立环境
conda create -n dl python=3.10
conda activate dl
pip install torch torchvision –index-url https://download.pytorch.org/whl/cu124 - 使用 Conda 或 Python虚拟环境 管理依赖:
-
稳定性优化
- 禁用自动内核更新:
sudo apt-mark hold linux-image-generic linux-headers-generic - 配置交换空间(Swap)或ZRAM,避免内存不足崩溃。
- 禁用自动内核更新:
注意事项
- 避免非LTS版本(如Ubuntu 23.10),缺乏长期维护。
- 若使用特定硬件(如AMD GPU或边缘设备),需提前验证驱动支持。
- 生产环境建议配合Docker容器,确保环境可重现。
总结
Ubuntu 22.04 LTS 是目前平衡稳定性、硬件支持与软件生态的最佳选择。若项目依赖旧版系统库,可考虑20.04 LTS,但需规划未来升级路径。部署后务必定期更新安全补丁,并备份关键数据。
CLOUD技术笔记