Vengo de Python , donde con beautiful soup puedes analizar todo el html tree sin crear solicitudes de get en páginas web externas . Estoy buscando lo mismo en javascript , pero solo encontré jsdom y jssoup (que parece no usarse) y si estoy en lo correcto, solo te permiten hacer solicitudes. Quiero una biblioteca en js que me permita analizar todo el html tree sin obtener errores de política CORS , es decir, sin realizar una solicitud, solo analizándolo.
¿Cómo puedo hacer esto?
En un contexto de navegador, puede usar DOMParser :
const html = "<h1>title</h1>"; const parser = new DOMParser(); const parsed = parser.parseFromString(html, "text/html"); console.log(parsed.firstChild.innerText); // "title"y en el nodo puedes usar node-html-parser :
import { parse } from 'node-html-parser'; const html = "<h1>title</h1>"; const parsed = parse(html); console.log(parsed.firstChild.innerText); // "title"