Estoy tratando de obtener los datos de la empresa de este sitio web llamado web similar, pero al realizar muchas solicitudes, reconoce mi secuencia de comandos como un bot, ¿hay alguna forma de omitir esta verificación? o sugerir cualquier sitio web para eliminar datos fácilmente, por cierto, no podemos usar LinkedIn.
const puppeteer = require("puppeteer"); const searchCompany = "zoominfo.com"; const Link = `https://www.similarweb.com/website/${searchCompany}/#overview`; // console.log(companyPage); let page; (async function () { try { let browserOpen = await puppeteer.launch({ headless: false, // dumpio: true, // args: ["--start-maximized"], defaultViewport: null, }); let newTab = await browserOpen.newPage(); await newTab.goto(Link); await newTab.screenshot({ path: "sc.png" }); await newTab.waitForSelector(".data-company-info__row"); let ans = await newTab.evaluate(() => { let name = document.querySelectorAll(".data-company-info__row")[0] .textContent; let location = document.querySelectorAll(".data-company-info__row")[3] .textContent; let industry = document.querySelectorAll(".data-company-info__row")[5] .textContent; // console.log(ans); return { name, location, industry }; }); console.log(ans); await browserOpen.close(); } catch (err) { console.log(err); } })();Solo por curiosidad, ¿para qué usa los datos de similarweb?
Puede intentar usar https://github.com/bda-research/node-crawler que tiene retrasos y parámetros máximos de conexiones