Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

158
Vistas
zgrep en la transmisión de hadoop

Estoy intentando grep un archivo zip en S3/aws y escribir el resultado en una nueva ubicación con el mismo nombre de archivo

Estoy usando a continuación en s3, ¿es esta la forma correcta de escribir la salida de transmisión desde el primer comando CAT a la salida hdfs?

 hadoop fs -cat s3://analytics/LZ/2017/03/03/test_20170303-000000.tar.gz | zgrep -a -E '*word_1*|*word_2*|word_3|word_4' | hadoop fs -put - s3://prod/project/test/test_20170303-000000.tar.gz
about 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

  1. Dado que está jugando con Hadoop, ¿por qué no ejecutar el código en el clúster? Es común buscar cadenas dentro de un archivo .gzip, aunque no conozco los archivos .tar.
  2. Personalmente, usaría los comandos -copyToLocal y -copyFromLocal para copiarlo en el FS local y trabajar allí. El problema con cosas como -cat es que muchas cosas se cierran en el código del cliente de Hadoop, por lo que es probable que una canalización recoja demasiada basura superflua.
about 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda