Instalé el tiempo de ejecución de CUDA y la versión 7.0 de los controladores en mi estación de trabajo (Ubuntu 14.04, 2xIntel XEON e5 + 4x Tesla k20m). He usado el siguiente programa para verificar si mi instalación funciona:
#include <stdio.h> __global__ void helloFromGPU() { printf("Hello World from GPU!\n"); } int main(int argc, char **argv) { printf("Hello World from CPU!\n"); helloFromGPU<<<1, 1>>>(); printf("Hello World from CPU! Again!\n"); cudaDeviceSynchronize(); printf("Hello World from CPU! Yet again!\n"); return 0; }Obtengo el resultado correcto, pero ha tomado una gran cantidad de tiempo:
$ nvcc hello.cu -O2 $ time ./hello > /dev/null real 0m8.897s user 0m0.004s sys 0m1.017s`Si elimino todo el código del dispositivo, la ejecución general demora 0.001 s. Entonces, ¿por qué mi programa simple tarda casi 10 segundos?
El aparente tiempo de ejecución lento de su ejemplo se debe al costo fijo subyacente de configurar el contexto de la GPU.
Debido a que está ejecutando en una plataforma que admite el direccionamiento unificado, el tiempo de ejecución de CUDA tiene que asignar 64 GB de RAM del host y 4 x 5120 MB de sus GPU en un solo espacio de direcciones virtuales y registrarlo con el kernel de Linux.
Se requieren muchas llamadas a la API del kernel para hacer eso, y no es rápido. Supongo que esa es la principal fuente del bajo rendimiento que está observando. Debe ver esto como un costo fijo de puesta en marcha que debe amortizarse durante la vida útil de su aplicación. En aplicaciones del mundo real, un inicio de 10 segundos es trivial y sin importancia real. En un ejemplo de hola mundo, no lo es.