Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

401
Views
¿Debo ejecutar el rastreador de Glue cada vez para obtener los datos más recientes?

Tengo un depósito S3 llamado Empleado. Cada tres horas recibiré un archivo en el cubo con una marca de tiempo adjunta. Usaré el trabajo Glue para mover el archivo de S3 a Redshift con algunas transformaciones. Mi archivo de entrada en el depósito S3 tendrá una estructura fija. My Glue Job utilizará la tabla creada en Data Catalog a través del rastreador como entrada.

Primer intento:

 datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "test", table_name = "employee_623215", transformation_ctx = "datasource0")

Después de tres horas, si obtengo un archivo más para el empleado, ¿debería rastrearlo nuevamente?

¿Hay alguna manera de tener una sola tabla en Data Catalog como empleado y actualizar la tabla con el archivo S3 más reciente que Glue Job puede usar para el procesamiento? ¿O debo ejecutar el rastreador cada vez para obtener los datos más recientes? El problema con eso es que se creará una mayor cantidad de tablas en mi catálogo de datos.

Por favor, hágamelo saber si esto es posible.

over 4 years ago · Santiago Trujillo
2 answers
Answer question

0

Solo necesita ejecutar AWS Glue Crawler nuevamente si el esquema cambia. Siempre que el esquema permanezca sin cambios, puede simplemente agregar archivos a Amazon S3 sin tener que volver a ejecutar el Crawler.

Actualización: el comentario de @Eman a continuación es correcto

Si está leyendo del catálogo, esta sugerencia no funcionará. Las particiones no se actualizarán en la tabla del catálogo si no vuelve a rastrear. La ejecución del rastreador asigna esas nuevas particiones a la tabla y le permite procesar las particiones del día siguiente.

over 4 years ago · Santiago Trujillo Report

0

Un enfoque alternativo puede ser, en lugar de leer del catálogo, leer directamente desde s3 y procesar los datos en el trabajo de Glue.

De esta manera, no necesita volver a ejecutar el rastreador.

Usar

from_options(tipo_conexión, opciones_conexión={}, formato=Ninguno, opciones_formato={}, transformación_ctx="")

Documentado aquí

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!