Recibo archivos .csv muy grandes (5 TB) de mis clientes en depósitos S3. Tengo que procesar estos archivos, agregarles columnas y almacenarlos nuevamente.
Es posible que deba trabajar con los archivos de la misma manera que aumento la cantidad de funciones para futuros modelos mejorados.
Claramente, debido a que S3 almacena datos como objetos, cada vez que hago un cambio, tengo que leer y escribir 5 TB de datos.
¿Cuál es el mejor enfoque que puedo tomar para procesar estos datos de manera rentable y rápida?
Gracias
Primero, una advertencia: el tamaño máximo de un objeto en Amazon S3 es de 5 TB . Si va a agregar información que resulte en un objeto más grande, es probable que alcance ese límite.
La forma más inteligente de procesar esta cantidad de datos es hacerlo en paralelo y preferiblemente en varios archivos más pequeños en lugar de un solo archivo de 5 TB.
Amazon EMR (en realidad, un entorno de Hadoop administrado) es excelente para realizar operaciones distribuidas en grandes conjuntos de datos. Puede procesar datos de muchos archivos en paralelo y puede comprimir/descomprimir datos sobre la marcha. Es complejo de aprender, pero muy eficiente y capaz.
Si se apega a su método actual de procesamiento de datos, le recomendaría: