En el siguiente código de muestra, en one cell de nuestro cuaderno de Azure Databricks , el código carga alrededor de 20 millones de registros en un dataframe de datos de Python pandas desde una base de datos de Azure SQL db , realiza una transformación de la columna del marco de datos aplicando algunas funciones (como se muestra en el fragmento de código a continuación ). Pero después de ejecutar el código durante aproximadamente media hora, los Databricks arrojan el siguiente error:
Error :
ConnectException: Connection refused (Connection refused) Error while obtaining a new communication channel ConnectException error: This is often caused by an OOM error that causes the connection to the Python REPL to be closed. Check your query's memory usage. Observaciones : la tabla tiene alrededor de 150 columnas. La Spark setting en los Databricks es la siguiente: Clúster : 128 GB , 16 Cores, DBR 8.3, Spark 8.3, Scala 2.12
Pregunta : ¿Cuál podría ser la causa del error y cómo podemos solucionarlo?
import sqlalchemy as sq import pandas as pd def fn_myFunction(lastname): testvar = lastname.lower() testvar = testvar.strip() return testvar pw = dbutils.secrets.get(scope='SomeScope',key='sql') engine = sq.create_engine('mssql+pymssql://SERVICE.Databricks.NONPUBLICETL:'+pw+'MyAzureSQL.database.windows.net:1433/TEST', isolation_level="AUTOCOMMIT") app_df = pd.read_sql('select * from MyTable', con=engine) #create new column app_df['NewColumn'] = app_df['TestColumn'].apply(lambda x: fn_myFunction(x)) ............. .............Esto significa que el controlador se bloqueó debido a una excepción OOM (memoria insuficiente) y, después de eso, no puede establecer una nueva conexión con el controlador.
Por favor, pruebe las siguientes opciones
Para obtener más información, siga este artículo de Aditi Sinha
Primero, podemos entender la razón más común del problema OOM con el nodo del controlador.
Una causa común de este error es que el controlador está experimentando un cuello de botella en la memoria. Cuando esto sucede, el controlador falla con una condición de falta de memoria (OOM) y se reinicia o deja de responder debido a la frecuente recolección de elementos no utilizados. El motivo del cuello de botella de la memoria puede ser cualquiera de los siguientes:
¿Por qué sucedió esto en tu caso?
Cuando procesamos conjuntos de datos a través de Pandas , ejecutan operaciones en una sola máquina (nodo de controlador), no como PySpark se ejecuta en varias máquinas. Si está trabajando para manejar conjuntos de datos más grandes, a través de pandas de python, no importa qué tan grande sea el clúster. Por lo tanto, puede aumentar el tamaño de la memoria del nodo del controlador o el procesamiento en modo distribuido.