Soy un aspirante a desarrollador. Como uno de mis proyectos, estoy aprendiendo a hacer web scraping. El objetivo aquí es raspar una página web determinada para cualquier enlace que sea PDF y guardar esos enlaces en un archivo de texto en NodeJS. Con el código dado, estoy registrando con éxito en la consola todos los enlaces coincidentes, pero solo obtengo un archivo escrito en mi archivo de texto. ¿Puede alguien guiarme en la dirección correcta?
const puppeteer = require("puppeteer"); const fs = require("fs/promises"); let myNewURL = "https://www.renault.co.il/cars/Zoe/index.html?fbclid=IwAR1RtxbC_U2fImp9_KXJuQ869h5Wv77fyZVj8uBOU86rU90wb2L_NfrNppc"; async function scrapeSite(url) { console.log("firing"); const browser = await puppeteer.launch({ headless: true }); const page = await browser.newPage(); await page.goto(url); //this gives back an actual array, not a node list const linkCollection = await page.$$eval("a", (links) => { return links.map((link) => { return link.href; }); }); for (const link of linkCollection) { if (link.includes(".pdf")) { console.log(link); await fs.writeFile("pdfLinks.txt", link); } } await browser.close(); } scrapeSite(myNewURL);fs.writeFile sobrescribe el archivo original con cada llamada. Pruebe fs.appendFile en su lugar. También agregué una nueva línea ( \n ) al final para que los enlaces estén en líneas individuales:
for (const link of linkCollection) { if (link.includes(".pdf")) { console.log(link); await fs.appendFile("pdfLinks.txt", link + '\n'); } }Alternativamente, primero puede recopilar los enlaces en una matriz y luego escribirlos todos juntos:
const pdfLinks = []; for (const link of linkCollection) { if (link.includes(".pdf")) { console.log(link); pdfLinks.push(link); } } const output = pdfLinks.join('\n') await fs.writeFile("pdfLinks.txt", output);usar agregar bandera:
await fs.writeFile("pdfLinks.txt", link+'\n',{flag:'a'});