Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

324
Views
Mejor/mejor enfoque para cargar un archivo CSV enorme en DynamoDb

Tengo un enorme archivo .csv en mi máquina local. Quiero cargar esos datos en un DynamoDB (eu-west-1, Irlanda). ¿Cómo lo harías tú?

  1. Mi primer acercamiento fue:

    • Iterar el archivo CSV localmente
    • Envíe una fila a AWS a través de curl -X POST -d '<row>' .../connector/mydata
    • Procese la llamada anterior dentro de una lambda y escriba en DynamoDB

    No me gusta esa solución porque:

    • Hay demasiadas solicitudes
    • Si envío datos sin la información del encabezado CSV, tengo que codificar la lambda
    • Si envío datos con el encabezado CSV hay demasiado tráfico
  2. También estaba considerando poner el archivo en un depósito S3 y procesarlo con una lambda , pero el archivo es enorme y la memoria y los límites de tiempo de la lambda me asustan.

  3. También estoy considerando hacer el trabajo en una máquina EC2, pero pierdo reactividad (si apago la máquina mientras no la uso) o pierdo dinero (si no apago la máquina).

  4. Me dijeron que Kinesis puede ser una solución, pero no estoy convencido.

Dígame cuál sería el mejor enfoque para obtener el huge CSV en DynamoDB si fuera yo. Quiero minimizar la carga de trabajo para una "segunda" carga.

Prefiero usar Node.js o R. Python puede ser aceptable como última solución.

about 4 years ago · Santiago Trujillo
2 answers
Answer question

0

Si desea hacerlo a la manera de AWS, las canalizaciones de datos pueden ser el mejor enfoque:

Aquí hay un tutorial que hace un poco más de lo que necesita, pero debería ayudarlo a comenzar:

La primera parte de este tutorial explica cómo definir una canalización de AWS Data Pipeline para recuperar datos de un archivo delimitado por tabuladores en Amazon S3 para completar una tabla de DynamoDB, usar un script de Hive para definir los pasos de transformación de datos necesarios y crear automáticamente un Amazon Clúster EMR para realizar el trabajo.

http://docs.aws.amazon.com/datapipeline/latest/DeveloperGuide/dp-importexport-ddb-part1.html

about 4 years ago · Santiago Trujillo Report

0

Si todos sus datos están en S3, puede usar la plantilla predefinida de canalización de datos de AWS para "importar datos de DynamoDB desde S3". Debería ser fácil de configurar.

about 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!