Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

160
Views
zgrep en la transmisión de hadoop

Estoy intentando grep un archivo zip en S3/aws y escribir el resultado en una nueva ubicación con el mismo nombre de archivo

Estoy usando a continuación en s3, ¿es esta la forma correcta de escribir la salida de transmisión desde el primer comando CAT a la salida hdfs?

 hadoop fs -cat s3://analytics/LZ/2017/03/03/test_20170303-000000.tar.gz | zgrep -a -E '*word_1*|*word_2*|word_3|word_4' | hadoop fs -put - s3://prod/project/test/test_20170303-000000.tar.gz
over 4 years ago · Santiago Trujillo
1 answers
Answer question

0

  1. Dado que está jugando con Hadoop, ¿por qué no ejecutar el código en el clúster? Es común buscar cadenas dentro de un archivo .gzip, aunque no conozco los archivos .tar.
  2. Personalmente, usaría los comandos -copyToLocal y -copyFromLocal para copiarlo en el FS local y trabajar allí. El problema con cosas como -cat es que muchas cosas se cierran en el código del cliente de Hadoop, por lo que es probable que una canalización recoja demasiada basura superflua.
over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!