Tengo un script simple para manejar un archivo CSV con un tamaño de 10 GB. La idea es bastante simple.
Hice el siguiente código, pero causó una pérdida de memoria. He intentado muchas cosas diferentes, pero nada ayuda. La fuga de memoria desaparece si quito el transformador de las tuberías. Tal vez cause pérdida de memoria.
Ejecuto el código en NodeJS.
¿Pueden ayudarme a encontrar dónde me equivoco?
'use strict'; import fs from 'node:fs'; import {parse, transform, stringify} from 'csv'; import lineByLine from 'n-readlines'; // big input file const inputFile = './input-data.csv'; // read headers first const linesReader = new lineByLine(inputFile); const firstLine = linesReader.next(); linesReader.close(); const headers = firstLine.toString() .split(',') .map(header => { return header .replace(/^"/, '') .replace(/"$/, '') .replace(/\s+/g, '_') .replace('(', '_') .replace(')', '_') .replace('.', '_') .replace(/_+$/, ''); }); // file stream const fileStream1 = fs.createReadStream(inputFile); // parser stream const parserStream1 = parse({delimiter: ',', cast: true, columns: headers, from_line: 1}); // transformer const transformer = transform(function(record) { return Object.assign({}, record, { SomeField: 'BlaBlaBla', }); }); // stringifier stream const stringifier = stringify({delimiter: ','}); console.log('Loading data...'); // chain of pipes fileStream1.on('error', err => { console.log(err); }) .pipe(parserStream1).on('error', err => {console.log(err); }) .pipe(transformer).on('error', err => { console.log(err); }) .pipe(stringifier).on('error', err => { console.log(err); }) .pipe(fs.createWriteStream('./_data/new-data.csv')).on('error', err => { console.log(err); }) .on('finish', () => { console.log('Loading data finished!'); });