Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

209
Vistas
Código de titiritero para respetar el archivo robots.txt

Esto parece ser posible en Scrapy Scrapy y respecto a robots.txt , pero ¿hay una forma sencilla de hacerlo en Puppeteer?

No he encontrado una manera fácil de incorporar "respetar a los robots" en los comandos de Titiritero.

about 4 years ago · Juan Pablo Isaza
1 Respuestas
Responde la pregunta

0

No creo que el titiritero tenga nada incorporado, pero puede usar el titiritero para acceder a robots.txt y luego usar cualquiera de los módulos npm para analizar robots.txt y ver si tiene permiso para obtener una URL en particular. Por ejemplo, así es como podría usar robots-txt-parser :

 const robotsParser = require('robots-txt-parser') const robots = robotsParser() // Now inside an async function // (or not if using a version of Node.js that supports top-level await) await robots.useRobotsFor('https://example.com/') if (await robots.canCrawl(urlToVisit)) { // Do stuff with puppeteer here to visit the URL } else { // Inform the user that sadly crawling that URL is forbidden }
about 4 years ago · Juan Pablo Isaza Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda