Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

137
Visualizações
Scrape páginas web en tiempo real con Node.js

Lo bueno fue raspar el contenido del sitio web usando Node.js. Me gustaría crear algo muy, muy rápido que pueda ejecutar búsquedas al estilo de kayak.com , donde una consulta se envía a varios sitios diferentes, los resultados se extraen y se devuelven al cliente a medida que están disponibles.

Supongamos que este script solo debe proporcionar los resultados en formato JSON y podemos procesarlos directamente en el navegador o en otra aplicación web.

Algunos puntos de partida:

Usando node.js y jquery para raspar sitios web

¿Alguien tiene ideas?

over 4 years ago · Santiago Trujillo
3 Respostas
Responde à pergunta

0

Node.io parece llevarse la palma :-)

over 4 years ago · Santiago Trujillo Relatório

0

Todas las soluciones antes mencionadas suponen ejecutar el raspador localmente. Esto significa que tendrá un rendimiento muy limitado (debido a que se ejecutan en secuencia o en un conjunto limitado de subprocesos). Un mejor enfoque, en mi humilde opinión, es confiar en una red de raspado existente, aunque comercial.

Aquí hay un ejemplo:

 var bobik = new Bobik("YOUR_AUTH_TOKEN"); bobik.scrape({ urls: ['amazon.com', 'zynga.com', 'http://finance.google.com/', 'http://shopping.yahoo.com'], queries: ["//th", "//img/@src", "return document.title", "return $('script').length", "#logo", ".logo"] }, function (scraped_data) { if (!scraped_data) { console.log("Data is unavailable"); return; } var scraped_urls = Object.keys(scraped_data); for (var url in scraped_urls) console.log("Results from " + url + ": " + scraped_data[scraped_urls[url]]); });

Aquí, el raspado se realiza de forma remota y se emite una devolución de llamada a su código solo cuando los resultados están listos (también hay una opción para recopilar resultados a medida que estén disponibles).

Puede descargar el SDK de proxy de cliente de Bobik en https://github.com/emirkin/bobik_javascript_sdk

over 4 years ago · Santiago Trujillo Relatório

0

Yo mismo he estado investigando y https://npmjs.org/package/wscraper se jacta de ser un

un agente web scraper basado en cheerio.js una implementación rápida, flexible y eficiente de core jQuery; construido sobre request.js; inspirado en http-agent.js

Muy poco uso (según npmjs.org) pero vale la pena echarle un vistazo a cualquier parte interesada.

over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda