He creado un lago de datos con AWS Lake Formation y AWS Glue Crawler para crear un catálogo a partir de la tabla de DynamoDB (tamaño: 130 GB, ItemCount: 739 013 546). Han pasado 12 horas desde que comencé la ejecución del rastreador, pero aún muestra Starting como Status .
¿Es normal que tarde tanto tiempo?
PD: La función asignada al rastreador tiene permiso para escanear la tabla de DynamoDB que quiero.
EDITAR:
El único evento de registro en CloudWatch es
{ "events": [ { "timestamp": 1582560218096, "message": "[6a56a417-0617-4253-a6be-091cc367328b] BENCHMARK : Running Start Crawl for Crawler dynamodb-crawler", "ingestionTime": 1582560344705 } ] }Este podría ser un problema diferente, pero es posible que el escaneo tarde mucho tiempo si su tabla es muy grande.
Tuve el mismo problema al intentar rastrear una base de datos Oracle local. Lo detuve después de una hora sin más registros que el registro inicial:
BENCHMARK : Running Start Crawl for Crawler Luego, todos los registros llegaron con marcas de tiempo que van desde que comenzó el rastreo hasta que lo detuve. No estoy seguro de por qué no aparecían antes o por qué el rastreador todavía estaba en el estado Starting , pero en mi caso, en realidad se estaba ejecutando.
Es extraño que me haya tomado tanto tiempo. ¿Están los registros del rastreador en Cloud Watch escupiendo algo?