Configuré una primera tabla de Hive con archivos comprimidos con GZIP:
CREATE EXTERNAL TABLE table_gzip ( col1, col2, col3 ) ROW FORMAT DELIMITED, FIELDS TERMINATED BY ',' LINES TERMINATED BY '\n' LOCATION 's3://bucket/files_gzip/';Luego configuré otra tabla Hive con formato ORC:
CREATE EXTERNAL TABLE table_orc ( col1, col2, col3 ) STORED AS ORC LOCATION 's3://bucket/files_orc/'; ALTER TABLE table_orc SET tblproperties ("orc.compress" ="SNAPPY");Y luego descomprimí y volví a comprimir de GZIP a ORC usando esta consulta:
INSERT OVERWRITE TABLE table_gzip SELECT * FROM table_orcUna vez que finalizó esta consulta, tuve nuevos archivos comprimidos con ORC en 's3://bucket/files_orc/'. Hasta aquí todo bien.
Sin embargo, cuando miré los archivos, pasaron de 500 archivos de 1,2 GiB a 500 archivos de 1,6 GiB .
¿Qué hice mal? ¿Por qué mis archivos comprimidos ORC-SNAPPY son más grandes que los archivos originales? ¿Es GZIP un mejor método de compresión?
Gracias por tu tiempo.