Un novato de Spark aquí. Recientemente comencé a jugar con Spark en mi máquina local en dos núcleos usando el comando:
pyspark --master local[2] Tengo un archivo de texto de 393 Mb que tiene casi un millón de filas. Quería realizar alguna operación de manipulación de datos. Estoy usando las funciones de marco de datos integradas de PySpark para realizar operaciones simples como groupBy , sum , max , stddev .
Sin embargo, cuando hago exactamente las mismas operaciones en pandas en el mismo conjunto de datos, parece que pandas vence a pyspark por un gran margen en términos de latencia.
Me preguntaba cuál podría ser una posible razón para esto. Tengo un par de pensamientos.
Gracias por mirar. Muy apreciado.
Porque:
Puedes seguir así durante mucho tiempo...