Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

311
Views
Obtenga solo HTML <head> de la URL

Mi pregunta es similar a esta sobre Python , pero, a diferencia de ella, la mía es sobre Javascript.

1. El problema

  1. Tengo una gran lista de URL de páginas web (alrededor de 10k) en texto sin formato;
  2. Para cada página @ URL (o para la mayoría de) necesito encontrar algunos metadatos y un título ;
  3. Quiero NO CARGAR páginas completas, solo cargar todo antes de </head> etiqueta de cierre.

2. Las preguntas

  1. ¿Es posible abrir una transmisión, cargar algunos bytes y, al llegar a </head> , cerrar la transmisión y la conexión? ¿Si es así, cómo?
  2. Py's urllib.request.Request.read() tiene un argumento de "tamaño" en número de bytes, pero ReadableStreamDefaultReader.read() de JS no. ¿Qué debo usar en JS entonces como alternativa?
  3. ¿Reducirá este enfoque el tráfico de red, el uso de ancho de banda, el uso de CPU y memoria?
about 4 years ago · Santiago Trujillo
2 answers
Answer question

0

Respuesta para la pregunta 2:

Intente usar la búsqueda de nodo-fetch fetch(url, {size: 200})

https://github.com/node-fetch/node-fetch#fetchurl-options

about 4 years ago · Santiago Trujillo Report

0

No sé si existe un método en el que pueda obtener solo el elemento principal de una respuesta, pero puede cargar todo el documento HTML y luego analizar el encabezado aunque no sea tan eficiente en comparación con otros métodos. . Hice una aplicación básica usando axios y cheerio para obtener el elemento principal de una serie de URL. Espero que esto pueda ayudar a alguien.

 const axios = require("axios") const cheerio = require("cheerio") const URLs = ["https://stackoverflow.com/questions/73191546/get-only-html-head-from-url"] for (let i = 0; i < URLs.length; i++) { axios.get(URLs[i]) .then(html => { const document = html.data // get the start index and the end index of the head const startHead = document.indexOf("<head>") const endHead = document.indexOf("</head>") + 7 //get the head as a string const head = document.slice(startHead, endHead) // load cheerio const $ = cheerio.load(head) // get the title from the head which is loaded into cheerio console.log($("title").html()) }) .catch(e => console.log(e)) }
about 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!