hola, estoy tratando de leer pdf en node js. cuando trato de leer este pdf . comienza a mostrar este error.
(while reading XRef): Error: Invalid XRef stream header Error: Error: Invalid XRef stream header at error (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:195:9) at XRef_readXRef [as readXRef] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:5692:9) at XRef_parse [as parse] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:5280:28) at PDFDocument_setup [as setup] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:4622:17) at PDFDocument_parse [as parse] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:4506:12) at LocalPdfManager_ensure [as ensure] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:32515:24) at LocalPdfManager.BasePdfManager_ensureModel [as ensureModel] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:32451:19) at Object.eval [as onResolve] (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:27142:22) at Object.runHandlers (eval at <anonymous> (/home/satyaarth/Desktop/react/baby/node_modules/pdf2json/lib/pdf.js:62:1), <anonymous>:864:35) at listOnTimeout (internal/timers.js:557:17) Error: Invalid XRef stream header error: { parserError: 'Error: Invalid XRef stream header' }aquí está mi código también
import { PdfReader } from "pdfreader"; new PdfReader().parseFileItems("./GeM-Bidding-3342395.pdf", (err, item) => { if (err) console.error("error:", err); else if (!item) console.warn("end of file"); else if (item.text) console.log(item.text); });pero cuando trato de analizar el mismo pdf usando analizadores en línea, el pdf se analiza y aquí hay una muestra. y también sujjest si no de esta manera, ¿cómo puedo extraer los datos usando api o algo así?
Desde cualquier sistema de consola OS (Linux Mac Windows), la forma más fácil de analizar un PDF es usar cualquiera de los comandos de utilidad pdftotext - Xpdf o Poppler (generalmente 64 bits) Windows binary aquí
Para exportar, digamos, dos páginas a la consola, use pdftotext -nopgbrk -f 1 -l 2 GeM-Bidding-3342395.pdf - Para guardar en un archivo, use un nombre de archivo en lugar de - o canalice a otro comando
La secuencia de salida puede variar según las opciones, por lo que lo anterior sin mod se ve así: 
Sin embargo, si agrego -layout en la versión poppler es más como esto:-
Y hay otras opciones en la versión Xpdf, como -table -simple -simple2, por lo que debe elegir la que mejor se adapte a sus deseos.