Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

454
Views
¿Cuál es la diferencia entre el trabajo ETL de AWS Glue y AWS EMR?

Si tuviera que realizar ETL en un conjunto de datos enorme (por ejemplo, 1 TB) almacenado en S3 como archivos csv, se pueden usar tanto el trabajo ETL de AWS Glue como los pasos de EMR de AWS. Entonces, ¿en qué se diferencia AWS Glue de AWS EMR? Y cuál es la mejor solución en este caso.

over 4 years ago · Santiago Trujillo
3 answers
Answer question

0

Glue le permite enviar scripts ETL directamente en PySpark/Python/Scala, sin necesidad de administrar un clúster EMR. Se gestiona todo el montaje/desmontaje de la infraestructura.

También hay algunos otros componentes administrados como Crawlers, Glue Data Catalog, etc. que facilitan el trabajo con sus datos.

Puede usar cualquiera de los dos para su caso de uso, Glue sería más rápido, sin embargo, es posible que no tenga la flexibilidad que obtiene con EMR.

over 4 years ago · Santiago Trujillo Report

0

La mayoría de las diferencias ya están enumeradas, por lo que me centraré más en el caso de uso específico.

Cuándo elegir pegamento aws

  1. El tamaño de los datos es enorme pero está estructurado, es decir, está en la estructura de la tabla y tiene un formato conocido (CSV, parquet, orc, json).
  2. Se requiere linaje, si necesita el gráfico de linaje de datos mientras desarrolla su trabajo de etl, prefiera desarrollar el etl usando bibliotecas nativas de pegamento.
  3. Los desarrolladores no necesitan modificar los parámetros de rendimiento, como establecer el número de ejecutores, la memoria por ejecutor, etc.
  4. No desea la sobrecarga de administrar un clúster grande y pagar solo por lo que usa.

Cuándo usar EMR

  1. Los datos son enormes, pero semiestructurados o no estructurados, por lo que no puede beneficiarse del catálogo de Glue.
  2. Usted cree sólo en las salidas y no se requiere linaje.
  3. Debe definir más memoria por ejecutor según el tipo de trabajo y los requisitos.
  4. Puede administrar el clúster fácilmente o si tiene tantos trabajos que pueden ejecutarse simultáneamente en el clúster, ahorrándole dinero.
  5. En el caso de datos estructurados, debe usar EMR cuando desee más capacidades de Hadoop como Hive, listo para más análisis.

Así que depende de cuál sea su caso de uso. Ambos son un gran servicio.

over 4 years ago · Santiago Trujillo Report

0

Pegamento usa EMR debajo del capó. Esto es evidente cuando accede al controlador de su terminal de desarrollo de Glue.

Ahora, dado que Glue es un entorno Spark administrado o, por ejemplo, un entorno EMR administrado, viene con una flexibilidad reducida. El tipo de trabajadores que puede elegir es limitado. La cantidad de bibliotecas de idiomas que puede usar en su código Spark es limitada. Glue no admitía paquetes como pandas, numpy hasta hace poco. Las aplicaciones como presto no se pueden integrar con Glue, aunque Athena es una buena alternativa a una instalación separada de presto.

Sin embargo, el problema principal es que los trabajos de Glue tienen un tiempo de inicio en frío de entre 1 minuto y 15 minutos.

EMR es una buena opción para el análisis exploratorio de datos, pero para un entorno de producción con CI/CD, Glue parece ser la mejor opción.

EDITAR: los trabajos de pegamento ya no tienen un tiempo de espera de inicio en frío

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!