Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

408
Vistas
¿Debo ejecutar el rastreador de Glue cada vez para obtener los datos más recientes?

Tengo un depósito S3 llamado Empleado. Cada tres horas recibiré un archivo en el cubo con una marca de tiempo adjunta. Usaré el trabajo Glue para mover el archivo de S3 a Redshift con algunas transformaciones. Mi archivo de entrada en el depósito S3 tendrá una estructura fija. My Glue Job utilizará la tabla creada en Data Catalog a través del rastreador como entrada.

Primer intento:

 datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "test", table_name = "employee_623215", transformation_ctx = "datasource0")

Después de tres horas, si obtengo un archivo más para el empleado, ¿debería rastrearlo nuevamente?

¿Hay alguna manera de tener una sola tabla en Data Catalog como empleado y actualizar la tabla con el archivo S3 más reciente que Glue Job puede usar para el procesamiento? ¿O debo ejecutar el rastreador cada vez para obtener los datos más recientes? El problema con eso es que se creará una mayor cantidad de tablas en mi catálogo de datos.

Por favor, hágamelo saber si esto es posible.

over 4 years ago · Santiago Trujillo
2 Respuestas
Responde la pregunta

0

Solo necesita ejecutar AWS Glue Crawler nuevamente si el esquema cambia. Siempre que el esquema permanezca sin cambios, puede simplemente agregar archivos a Amazon S3 sin tener que volver a ejecutar el Crawler.

Actualización: el comentario de @Eman a continuación es correcto

Si está leyendo del catálogo, esta sugerencia no funcionará. Las particiones no se actualizarán en la tabla del catálogo si no vuelve a rastrear. La ejecución del rastreador asigna esas nuevas particiones a la tabla y le permite procesar las particiones del día siguiente.

over 4 years ago · Santiago Trujillo Denunciar

0

Un enfoque alternativo puede ser, en lugar de leer del catálogo, leer directamente desde s3 y procesar los datos en el trabajo de Glue.

De esta manera, no necesita volver a ejecutar el rastreador.

Usar

from_options(tipo_conexión, opciones_conexión={}, formato=Ninguno, opciones_formato={}, transformación_ctx="")

Documentado aquí

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda