Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

150
Vistas
Scrape páginas web en tiempo real con Node.js

Lo bueno fue raspar el contenido del sitio web usando Node.js. Me gustaría crear algo muy, muy rápido que pueda ejecutar búsquedas al estilo de kayak.com , donde una consulta se envía a varios sitios diferentes, los resultados se extraen y se devuelven al cliente a medida que están disponibles.

Supongamos que este script solo debe proporcionar los resultados en formato JSON y podemos procesarlos directamente en el navegador o en otra aplicación web.

Algunos puntos de partida:

Usando node.js y jquery para raspar sitios web

¿Alguien tiene ideas?

over 4 years ago · Santiago Trujillo
3 Respuestas
Responde la pregunta

0

Node.io parece llevarse la palma :-)

over 4 years ago · Santiago Trujillo Denunciar

0

Todas las soluciones antes mencionadas suponen ejecutar el raspador localmente. Esto significa que tendrá un rendimiento muy limitado (debido a que se ejecutan en secuencia o en un conjunto limitado de subprocesos). Un mejor enfoque, en mi humilde opinión, es confiar en una red de raspado existente, aunque comercial.

Aquí hay un ejemplo:

 var bobik = new Bobik("YOUR_AUTH_TOKEN"); bobik.scrape({ urls: ['amazon.com', 'zynga.com', 'http://finance.google.com/', 'http://shopping.yahoo.com'], queries: ["//th", "//img/@src", "return document.title", "return $('script').length", "#logo", ".logo"] }, function (scraped_data) { if (!scraped_data) { console.log("Data is unavailable"); return; } var scraped_urls = Object.keys(scraped_data); for (var url in scraped_urls) console.log("Results from " + url + ": " + scraped_data[scraped_urls[url]]); });

Aquí, el raspado se realiza de forma remota y se emite una devolución de llamada a su código solo cuando los resultados están listos (también hay una opción para recopilar resultados a medida que estén disponibles).

Puede descargar el SDK de proxy de cliente de Bobik en https://github.com/emirkin/bobik_javascript_sdk

over 4 years ago · Santiago Trujillo Denunciar

0

Yo mismo he estado investigando y https://npmjs.org/package/wscraper se jacta de ser un

un agente web scraper basado en cheerio.js una implementación rápida, flexible y eficiente de core jQuery; construido sobre request.js; inspirado en http-agent.js

Muy poco uso (según npmjs.org) pero vale la pena echarle un vistazo a cualquier parte interesada.

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda