使用GPU从docker容器?

我正在寻找一种从docker容器内使用GPU的方法。

容器将执行任意代码，所以我不想使用特权模式。

任何建议吗?

从以前的研究中，我了解到运行-v和/或LXC cgroup是要走的路，但我不确定如何把它拉下来

当前回答

NVIDIA最近的改进提供了一种更健壮的方式来实现这一点。

从本质上讲，他们已经找到了一种方法，可以避免在容器内部安装CUDA/GPU驱动程序，并使其与主机内核模块匹配。

相反，驱动程序在主机上，容器不需要它们。现在需要修改docker-cli。

这很好，因为现在容器更加便携了。

Ubuntu上的一个快速测试:

# Install nvidia-docker and nvidia-docker-plugin
wget -P /tmp https://github.com/NVIDIA/nvidia-docker/releases/download/v1.0.1/nvidia-docker_1.0.1-1_amd64.deb
sudo dpkg -i /tmp/nvidia-docker*.deb && rm /tmp/nvidia-docker*.deb

# Test nvidia-smi
nvidia-docker run --rm nvidia/cuda nvidia-smi

详情见: 启用gpu的Docker容器和:https://github.com/NVIDIA/nvidia-docker

2017-06-16 00:08:15

其他回答

写一个更新的答案，因为大多数已经出现的答案现在已经过时了。

Docker 19.03之前的版本需要nvidia-docker2和——runtime=nvidia标志。

从Docker 19.03开始，你需要安装nvidia-container-toolkit包，然后使用——gpu all标志。

下面是一些基本原理，

包安装

根据Github的官方文档安装nvidia-container-toolkit包。

对于Redhat操作系统，执行以下命令:

$ distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
$ curl -s -L https://nvidia.github.io/nvidia-docker/$distribution/nvidia-docker.repo | sudo tee /etc/yum.repos.d/nvidia-docker.repo

$ sudo yum install -y nvidia-container-toolkit
$ sudo systemctl restart docker

对于Debian操作系统，需要执行以下命令:

# Add the package repositories
$ distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
$ curl -s -L https://nvidia.github.io/nvidia-docker/gpgkey | sudo apt-key add -
$ curl -s -L https://nvidia.github.io/nvidia-docker/$distribution/nvidia-docker.list | sudo tee /etc/apt/sources.list.d/nvidia-docker.list

$ sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
$ sudo systemctl restart docker

运行支持GPU的docker

docker run --name my_all_gpu_container --gpus all -t nvidia/cuda

请注意，标记——gpu all用于将所有可用的gpu分配给docker容器。

为docker容器分配特定的gpu(如果你的机器中有多个gpu可用)

docker run --name my_first_gpu_container --gpus device=0 nvidia/cuda

docker run --name my_first_gpu_container --gpus '"device=0"' nvidia/cuda

2019-10-17 12:39:03

翻译:

https://github.com/mviereck/x11docker硬件加速的说

硬件加速 OpenGL的硬件加速可以通过选项-g，——gpu实现。在大多数情况下，这将与主机上的开源驱动程序开箱即用。否则，请查看wiki: feature dependencies。闭源NVIDIA驱动程序需要一些设置，支持较少的x11docker X服务器选项。

这个脚本非常方便，因为它处理了所有的配置和设置。使用gpu在X上运行docker映像非常简单

x11docker --gpu imagename

2019-04-20 11:18:06

如果可以使用docker，我不建议在主机上安装CUDA/cuDNN。至少从CUDA 8开始，就可以“站在巨人的肩膀上”，并在Docker Hub回购中使用nvidia/ CUDA的基础映像。如果不确定选择哪个版本，就选择最新最大的版本(如果进行深度学习，则使用cuDNN)。

一个启动CUDA容器:

mkdir ~/cuda11
cd ~/cuda11

echo "FROM nvidia/cuda:11.0-cudnn8-devel-ubuntu18.04" > Dockerfile
echo "CMD [\"/bin/bash\"]" >> Dockerfile

docker build --tag mirekphd/cuda11 .

docker run --rm -it --gpus 1 mirekphd/cuda11 nvidia-smi

样例输出:

(如果容器中没有找到NVIDIA -smi，不要尝试在那里安装它-它已经安装在带有NVIDIA GPU驱动程序的主机上，如果docker可以访问GPU，它应该从主机到容器系统可用):

+-----------------------------------------------------------------------------+
| NVIDIA-SMI 450.57       Driver Version: 450.57       CUDA Version: 11.0     |
|-------------------------------+----------------------+----------------------+
| GPU  Name        Persistence-M| Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|                               |                      |               MIG M. |
|===============================+======================+======================|
|   0  GeForce GTX 108...  Off  | 00000000:01:00.0  On |                  N/A |
|  0%   50C    P8    17W / 280W |    409MiB / 11177MiB |      7%      Default |
|                               |                      |                  N/A |
+-------------------------------+----------------------+----------------------+

先决条件

首先在主机上安装适当的支持最新CUDA版本的NVIDIA驱动程序(从NVIDIA driver Downloads下载，然后mv driver-file.run driver-file.sh && chmod +x driver-file.sh && ./driver-file.sh)。自CUDA 10.1以来，这些都是向前兼容的。通过安装sudo apt get update && sudo apt get install nvidia-container-toolkit在docker中启用GPU访问(然后使用sudo systemctl restart docker重新启动docker守护进程)。

2020-08-02 11:38:40

我们刚刚发布了一个实验性的GitHub存储库，它可以简化在Docker容器中使用NVIDIA gpu的过程。

2015-11-05 05:28:06

目标:

我的目标是在不使用nvidia/ CUDA作为基础图像的情况下，制作一个CUDA启用的docker图像。因为我有一些自定义的木星图像，我想以此为基础。

先决条件:

主机上已经安装了nvidia驱动程序、CUDA工具包和nvidia-container-toolkit。请参考官方文件，以及Rohit的回答。

测试nvidia驱动和CUDA工具包是否正确安装:主机上的nvidia-smi，应该显示正确的“driver Version”和“CUDA Version”，并显示gpu信息。

测试nvidia-container-toolkit是否正确安装:docker run——rm——gpu all nvidia/cuda:最新的nvidia-smi

Dockerfile

我找到了我认为是nvidia/cuda的官方Dockerfile，在这里我“压平”它，将内容附加到我的Dockerfile中，并测试它工作得很好:

FROM sidazhou/scipy-notebook:latest
# FROM ubuntu:18.04 

###########################################################################
# See https://gitlab.com/nvidia/container-images/cuda/-/blob/master/dist/10.1/ubuntu18.04-x86_64/base/Dockerfile
# See https://sarus.readthedocs.io/en/stable/user/custom-cuda-images.html
###########################################################################
USER root

###########################################################################
# base
RUN apt-get update && apt-get install -y --no-install-recommends \
    gnupg2 curl ca-certificates && \
    curl -fsSL https://developer.download.nvidia.com/compute/cuda/repos/ubuntu1804/x86_64/7fa2af80.pub | apt-key add - && \
    echo "deb https://developer.download.nvidia.com/compute/cuda/repos/ubuntu1804/x86_64 /" > /etc/apt/sources.list.d/cuda.list && \
    echo "deb https://developer.download.nvidia.com/compute/machine-learning/repos/ubuntu1804/x86_64 /" > /etc/apt/sources.list.d/nvidia-ml.list && \
    apt-get purge --autoremove -y curl \
    && rm -rf /var/lib/apt/lists/*

ENV CUDA_VERSION 10.1.243
ENV CUDA_PKG_VERSION 10-1=$CUDA_VERSION-1

# For libraries in the cuda-compat-* package: https://docs.nvidia.com/cuda/eula/index.html#attachment-a
RUN apt-get update && apt-get install -y --no-install-recommends \
    cuda-cudart-$CUDA_PKG_VERSION \
    cuda-compat-10-1 \
    && ln -s cuda-10.1 /usr/local/cuda && \
    rm -rf /var/lib/apt/lists/*

# Required for nvidia-docker v1
RUN echo "/usr/local/nvidia/lib" >> /etc/ld.so.conf.d/nvidia.conf && \
    echo "/usr/local/nvidia/lib64" >> /etc/ld.so.conf.d/nvidia.conf

ENV PATH /usr/local/nvidia/bin:/usr/local/cuda/bin:${PATH}
ENV LD_LIBRARY_PATH /usr/local/nvidia/lib:/usr/local/nvidia/lib64


###########################################################################
#runtime next
ENV NCCL_VERSION 2.7.8

RUN apt-get update && apt-get install -y --no-install-recommends \
    cuda-libraries-$CUDA_PKG_VERSION \
    cuda-npp-$CUDA_PKG_VERSION \
    cuda-nvtx-$CUDA_PKG_VERSION \
    libcublas10=10.2.1.243-1 \
    libnccl2=$NCCL_VERSION-1+cuda10.1 \
    && apt-mark hold libnccl2 \
    && rm -rf /var/lib/apt/lists/*

# apt from auto upgrading the cublas package. See https://gitlab.com/nvidia/container-images/cuda/-/issues/88
RUN apt-mark hold libcublas10


###########################################################################
#cudnn7 (not cudnn8) next

ENV CUDNN_VERSION 7.6.5.32

RUN apt-get update && apt-get install -y --no-install-recommends \
    libcudnn7=$CUDNN_VERSION-1+cuda10.1 \
    && apt-mark hold libcudnn7 && \
    rm -rf /var/lib/apt/lists/*


ENV NVIDIA_VISIBLE_DEVICES all
ENV NVIDIA_DRIVER_CAPABILITIES all
ENV NVIDIA_REQUIRE_CUDA "cuda>=10.1"


###########################################################################
#docker build -t sidazhou/scipy-notebook-gpu:latest .

#docker run -itd -gpus all\
#  -p 8888:8888 \
#  -p 6006:6006 \
#  --user root \
#  -e NB_UID=$(id -u) \
#  -e NB_GID=$(id -g) \
#  -e GRANT_SUDO=yes \
#  -v ~/workspace:/home/jovyan/work \
#  --name sidazhou-jupyter-gpu \
#  sidazhou/scipy-notebook-gpu:latest

#docker exec sidazhou-jupyter-gpu python -c "import tensorflow as tf; print(tf.config.experimental.list_physical_devices('GPU'))"

2020-10-19 06:52:41

使用GPU从docker容器?

推荐文章

最新文章

标签