Los documentos de AWS Glue establecen claramente que los rastreadores extraen información de metadatos de la fuente (JDBS o s3) y completan el catálogo de datos (crean/actualizan la base de datos y las tablas correspondientes).
Sin embargo, no está claro si necesitamos ejecutar un rastreador regularmente para detectar nuevos datos en una fuente (es decir, nuevos objetos en s3, nuevas filas en la tabla db) si sabemos que no hay cambios en el esquema/partición.
Entonces, ¿es necesario ejecutar un rastreador antes de ejecutar un trabajo ETL para poder recopilar nuevos datos?
AWS Glue detectará automáticamente los datos nuevos en los depósitos de S3 siempre que estén dentro de sus carpetas (particiones) existentes.
Si se agregan datos a nuevas carpetas (particiones), debe volver a cargar sus particiones usando MSCK REPAIR TABLE mytable; .
Es necesario ejecutar el rastreador antes del trabajo.
El rastreador reemplaza Athena MSCK REPAIR TABLE y también actualiza la tabla con nuevas columnas a medida que se agregan.