Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

318
Visualizações
Obtenga solo HTML <head> de la URL

Mi pregunta es similar a esta sobre Python , pero, a diferencia de ella, la mía es sobre Javascript.

1. El problema

  1. Tengo una gran lista de URL de páginas web (alrededor de 10k) en texto sin formato;
  2. Para cada página @ URL (o para la mayoría de) necesito encontrar algunos metadatos y un título ;
  3. Quiero NO CARGAR páginas completas, solo cargar todo antes de </head> etiqueta de cierre.

2. Las preguntas

  1. ¿Es posible abrir una transmisión, cargar algunos bytes y, al llegar a </head> , cerrar la transmisión y la conexión? ¿Si es así, cómo?
  2. Py's urllib.request.Request.read() tiene un argumento de "tamaño" en número de bytes, pero ReadableStreamDefaultReader.read() de JS no. ¿Qué debo usar en JS entonces como alternativa?
  3. ¿Reducirá este enfoque el tráfico de red, el uso de ancho de banda, el uso de CPU y memoria?
about 4 years ago · Santiago Trujillo
2 Respostas
Responde à pergunta

0

Respuesta para la pregunta 2:

Intente usar la búsqueda de nodo-fetch fetch(url, {size: 200})

https://github.com/node-fetch/node-fetch#fetchurl-options

about 4 years ago · Santiago Trujillo Relatório

0

No sé si existe un método en el que pueda obtener solo el elemento principal de una respuesta, pero puede cargar todo el documento HTML y luego analizar el encabezado aunque no sea tan eficiente en comparación con otros métodos. . Hice una aplicación básica usando axios y cheerio para obtener el elemento principal de una serie de URL. Espero que esto pueda ayudar a alguien.

 const axios = require("axios") const cheerio = require("cheerio") const URLs = ["https://stackoverflow.com/questions/73191546/get-only-html-head-from-url"] for (let i = 0; i < URLs.length; i++) { axios.get(URLs[i]) .then(html => { const document = html.data // get the start index and the end index of the head const startHead = document.indexOf("<head>") const endHead = document.indexOf("</head>") + 7 //get the head as a string const head = document.slice(startHead, endHead) // load cheerio const $ = cheerio.load(head) // get the title from the head which is loaded into cheerio console.log($("title").html()) }) .catch(e => console.log(e)) }
about 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda