Me gustaría extraer el encabezado previo de un HTML usando expresiones regulares. El HTML se ve así:
<!DOCTYPE html><html> <head>...</head> <body dir="ltr" style="padding: 0; margin: 0"><div style="display: none; max-height: 0px; overflow: hidden;">This is my preheader — </div><table cellspacing="0" cellpadding="0" style="width: 100%"> ... </body></html> Esto significa que el encabezado previo se coloca directamente después de la etiqueta de inicio <body> como un elemento <div> . Además, tiene la display: none clase de estilo. Por lo tanto, creo que sería mejor extraer el primer elemento después de la etiqueta de inicio <body> , luego verificar si es un <div> con la clase de estilo correspondiente (de lo contrario, no se mantendrá el encabezado previo) y, de ser así, extraer el texto ignorando escapes y cosas como — .
Me gustaría implementar esto en JavaScript. Me ayudaría mucho 1) conocer la expresión regular para extraer el primer elemento después de la etiqueta de inicio <body> y 2) extraer el valor de texto sin formato del elemento <div> .
Muchas gracias por la ayuda de antemano.