Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

248
Vistas
¿Cómo utilizar S3 y EBS en tándem para realizar análisis rentables en AWS?

Recibo archivos .csv muy grandes (5 TB) de mis clientes en depósitos S3. Tengo que procesar estos archivos, agregarles columnas y almacenarlos nuevamente.

Es posible que deba trabajar con los archivos de la misma manera que aumento la cantidad de funciones para futuros modelos mejorados.

Claramente, debido a que S3 almacena datos como objetos, cada vez que hago un cambio, tengo que leer y escribir 5 TB de datos.

¿Cuál es el mejor enfoque que puedo tomar para procesar estos datos de manera rentable y rápida?

  1. Almacene un archivo de 5 TB en S3 como objeto, cada vez que lea el objeto, realice el procesamiento y guarde el resultado nuevamente en S3
  2. Almacene los 5 TB en S3 como objeto, lea el objeto, córtelo en objetos más pequeños y guárdelos de nuevo en S3 como varios objetos, de modo que en el futuro solo trabaje con los fragmentos que me interesan.
  3. Guarde todo en EBS desde el principio, móntelo en EC2 y realice el procesamiento

Gracias

over 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

Primero, una advertencia: el tamaño máximo de un objeto en Amazon S3 es de 5 TB . Si va a agregar información que resulte en un objeto más grande, es probable que alcance ese límite.

La forma más inteligente de procesar esta cantidad de datos es hacerlo en paralelo y preferiblemente en varios archivos más pequeños en lugar de un solo archivo de 5 TB.

Amazon EMR (en realidad, un entorno de Hadoop administrado) es excelente para realizar operaciones distribuidas en grandes conjuntos de datos. Puede procesar datos de muchos archivos en paralelo y puede comprimir/descomprimir datos sobre la marcha. Es complejo de aprender, pero muy eficiente y capaz.

Si se apega a su método actual de procesamiento de datos, le recomendaría:

  • Si su aplicación puede leer directamente desde S3, utilícelo como fuente. De lo contrario, copie los archivos a EBS.
  • Procesar los datos
  • Almacene la salida localmente en EBS, preferiblemente en archivos más pequeños (GB en lugar de TB)
  • Copie los archivos a S3 (o guárdelos en EBS si eso satisface sus necesidades)
over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda