No soy un experto en expresiones regulares y tengo un problema al intentar convertir una cadena html en una matriz de elementos html, por lo que la idea era si tomamos un ejemplo:
Cadena de muestra:
<p>Welcome to my awesome website for more info <a href="www.myanotherawesomewebsite.com" target="_blank">click here</a></p>(que en realidad puede ser cualquier combinación posible)
Así que quería obtener algo como:
'<p>', 'Welcome to my awesome website for more info','<a href="www.myanotherawesomewebsite.com" target="_blank">', 'click here','</a>',</p>'Entonces esto podría lograrse con la siguiente expresión regular:
/(<[^>]+>|[a-zè A-Z0-9]+)?/gEntonces, usando la función de coincidencia, para probar:
'<p>Welcome to my awesome website for more info <a href="www.myanotherawesomewebsite.com" target="_blank">click here</a></p>'.match(/(<[^>]+>|[a-zè A-Z0-9]+)?/g)y este funciona, sin embargo, hay un problema con los idiomas, para todo, excepto el inglés, funciona bien, pero cuando tengo caracteres en francés o alemán, esto ya no funciona ...
El trabajo en torno era hacer algo como:
/(<[^>]+>|[a-zàâäèéêëîïôœùûüÿçäöüÄÖÜÀÂÄÈÉÊËÎÏÔŒÙÛÜŸÇß!#.?”“«» A-Z0-9\-\u00A0]+)?/gque funciona pero no al 100%, además, no funciona en absoluto con cosas como 'sup' o 'sub', etc...
así que mi pregunta es... ¿hay alguna forma de mejorar esto? La ayuda y los consejos serán muy bienvenidos. Gracias de antemano por leer...
Simplemente puede usar [^<] para el nodo sin etiqueta en lugar de la enumeración de caracteres.
Además, no creo que necesites un signo de interrogación al final. Sería útil solo si tuviera una entrada de cadena vacía.
Así que el resultado de la expresión regular es /(<[^>]+>|[^<]+)/g