Descubrí que AWS Glue configuró la instancia del ejecutor con un límite de memoria de 5 Gb --conf spark.executor.memory=5g y algunas veces, en grandes conjuntos de datos, falla con java.lang.OutOfMemoryError . Lo mismo es para la instancia del controlador --spark.driver.memory=5g . ¿Hay alguna opción para aumentar este valor?
a pesar de que la documentación de aws indica que no se debe pasar el parámetro --conf , nuestro equipo de soporte de AWS nos dijo que --conf spark.driver.memory=10g , lo que solucionó el problema que teníamos
Puede anular los parámetros editando el trabajo y agregando parámetros de trabajo. La clave y el valor que utilicé están aquí:
Clave : --conf
Valor : chispa.hilo.executor.memoryOverhead=7g
Esto parecía contrario a la intuición ya que la clave de configuración está realmente en el valor, pero se reconoció. Entonces, si está intentando configurar spark.yarn.executor.memory, el siguiente parámetro sería apropiado:
Clave : --conf
Valor : spark.yarn.executor.memory=7g