Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

359
Vistas
Lecturas lentas en MongoDB de Spark: asignación de tareas extraña

Tengo un clúster MongoDB 4.2 con 15 fragmentos; la base de datos almacena una colección fragmentada de 6 GB (es decir, alrededor de 400 MB por máquina).

Estoy tratando de leer toda la colección de Apache Spark, que se ejecuta en la misma máquina. La aplicación de Spark se ejecuta con --num-executors 8 y --executor-cores 6 ; la conexión se realiza a través del conector de chispa configurando el MongoShardedPartitioner.

Además de que la lectura es muy lenta (alrededor de 1,5 minutos; pero, según tengo entendido, los escaneos completos generalmente son malos en MongoDB), estoy experimentando este comportamiento extraño en la asignación de tareas de Spark:

Asignación de tareas

Los problemas son los siguientes:

  1. Por alguna razón, solo uno de los ejecutores comienza a leer de la base de datos, mientras que todos los demás esperan 25 segundos para comenzar sus lecturas. Las barras rojas corresponden al "Tiempo de deserialización de la tarea", pero entiendo que simplemente están inactivas (si hay etapas concurrentes, estos ejecutores trabajan en otra cosa y luego regresan a esta etapa solo después de los 25 segundos).
  2. Por alguna otra razón, después de un tiempo, la asignación simultánea de tareas se suspende y luego se reanuda por completo (alrededor de 55 segundos desde el inicio del trabajo); puede verlo en el medio de la imagen, ya que se inicia un montón de tareas al mismo tiempo.

En general, el análisis completo podría completarse en mucho menos tiempo si las tareas se asignaran correctamente.

¿Cuál es el motivo de estos comportamientos y quién es el responsable (es Spark, Spark-Connector o MongoDB)? ¿Hay algún parámetro de configuración que pueda causar estos problemas?

over 4 years ago · Santiago Trujillo
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda