Estoy tratando de entrenar una red neuronal (Tensorflow) en AWS. Tengo algunos créditos de AWS. Según tengo entendido, AWS SageMaker es el mejor para el trabajo. Logré cargar la consola de Jupyter Lab en SageMaker e intenté encontrar un kernel de GPU, ya que sé que es el mejor para entrenar redes neuronales. Sin embargo, no pude encontrar dicho kernel.
¿Alguien podría ayudar en este sentido?
Gracias y Saludos cordiales
Miguel
Los modelos se entrenan en GPU en el ecosistema de SageMaker a través de 2 componentes diferentes:
Puede crear instancias de una instancia de SageMaker Notebook con GPU, por ejemplo, p2.xlarge (NVIDIA K80) o p3.2xlarge (NVIDIA V100). Esto es conveniente para el desarrollo interactivo: tiene la GPU justo debajo de su computadora portátil y puede ejecutar código en la GPU de forma interactiva y monitorear la GPU a través nvidia-smi en una pestaña de terminal: una gran experiencia de desarrollo. Sin embargo, cuando desarrolla directamente desde una máquina con GPU, hay momentos en los que es posible que no use la GPU. Por ejemplo, cuando escribe código o navega por alguna documentación. Todo ese tiempo pagas por una GPU que permanece inactiva. En ese sentido, puede que no sea la opción más rentable para su caso de uso.
Otra opción es usar un trabajo de capacitación de SageMaker que se ejecute en una instancia de GPU. Esta es una opción preferida para el entrenamiento, porque los metadatos de entrenamiento (ruta de datos y modelo, hiperparámetros, especificación de clúster, etc.) se conservan en el almacén de metadatos de SageMaker, los registros y las métricas se almacenan en Cloudwatch y la instancia se apaga automáticamente al final del entrenamiento. . Desarrollar en una pequeña instancia de CPU e iniciar tareas de capacitación con la API de capacitación de SageMaker lo ayudará a aprovechar al máximo su presupuesto, al tiempo que lo ayuda a conservar los metadatos y los artefactos de todos sus experimentos. Puede ver aquí un ejemplo de TensorFlow bien documentado
Todos los tipos de instancias de GPU y CPU de portátiles: documentación de AWS .