Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

356
Visualizações
Lecturas lentas en MongoDB de Spark: asignación de tareas extraña

Tengo un clúster MongoDB 4.2 con 15 fragmentos; la base de datos almacena una colección fragmentada de 6 GB (es decir, alrededor de 400 MB por máquina).

Estoy tratando de leer toda la colección de Apache Spark, que se ejecuta en la misma máquina. La aplicación de Spark se ejecuta con --num-executors 8 y --executor-cores 6 ; la conexión se realiza a través del conector de chispa configurando el MongoShardedPartitioner.

Además de que la lectura es muy lenta (alrededor de 1,5 minutos; pero, según tengo entendido, los escaneos completos generalmente son malos en MongoDB), estoy experimentando este comportamiento extraño en la asignación de tareas de Spark:

Asignación de tareas

Los problemas son los siguientes:

  1. Por alguna razón, solo uno de los ejecutores comienza a leer de la base de datos, mientras que todos los demás esperan 25 segundos para comenzar sus lecturas. Las barras rojas corresponden al "Tiempo de deserialización de la tarea", pero entiendo que simplemente están inactivas (si hay etapas concurrentes, estos ejecutores trabajan en otra cosa y luego regresan a esta etapa solo después de los 25 segundos).
  2. Por alguna otra razón, después de un tiempo, la asignación simultánea de tareas se suspende y luego se reanuda por completo (alrededor de 55 segundos desde el inicio del trabajo); puede verlo en el medio de la imagen, ya que se inicia un montón de tareas al mismo tiempo.

En general, el análisis completo podría completarse en mucho menos tiempo si las tareas se asignaran correctamente.

¿Cuál es el motivo de estos comportamientos y quién es el responsable (es Spark, Spark-Connector o MongoDB)? ¿Hay algún parámetro de configuración que pueda causar estos problemas?

over 4 years ago · Santiago Trujillo
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda