Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

242
Views
¿Cómo utilizar S3 y EBS en tándem para realizar análisis rentables en AWS?

Recibo archivos .csv muy grandes (5 TB) de mis clientes en depósitos S3. Tengo que procesar estos archivos, agregarles columnas y almacenarlos nuevamente.

Es posible que deba trabajar con los archivos de la misma manera que aumento la cantidad de funciones para futuros modelos mejorados.

Claramente, debido a que S3 almacena datos como objetos, cada vez que hago un cambio, tengo que leer y escribir 5 TB de datos.

¿Cuál es el mejor enfoque que puedo tomar para procesar estos datos de manera rentable y rápida?

  1. Almacene un archivo de 5 TB en S3 como objeto, cada vez que lea el objeto, realice el procesamiento y guarde el resultado nuevamente en S3
  2. Almacene los 5 TB en S3 como objeto, lea el objeto, córtelo en objetos más pequeños y guárdelos de nuevo en S3 como varios objetos, de modo que en el futuro solo trabaje con los fragmentos que me interesan.
  3. Guarde todo en EBS desde el principio, móntelo en EC2 y realice el procesamiento

Gracias

about 4 years ago · Santiago Trujillo
1 answers
Answer question

0

Primero, una advertencia: el tamaño máximo de un objeto en Amazon S3 es de 5 TB . Si va a agregar información que resulte en un objeto más grande, es probable que alcance ese límite.

La forma más inteligente de procesar esta cantidad de datos es hacerlo en paralelo y preferiblemente en varios archivos más pequeños en lugar de un solo archivo de 5 TB.

Amazon EMR (en realidad, un entorno de Hadoop administrado) es excelente para realizar operaciones distribuidas en grandes conjuntos de datos. Puede procesar datos de muchos archivos en paralelo y puede comprimir/descomprimir datos sobre la marcha. Es complejo de aprender, pero muy eficiente y capaz.

Si se apega a su método actual de procesamiento de datos, le recomendaría:

  • Si su aplicación puede leer directamente desde S3, utilícelo como fuente. De lo contrario, copie los archivos a EBS.
  • Procesar los datos
  • Almacene la salida localmente en EBS, preferiblemente en archivos más pequeños (GB en lugar de TB)
  • Copie los archivos a S3 (o guárdelos en EBS si eso satisface sus necesidades)
about 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!