Estoy tratando de obtener una lista de URL "https://www.crocodiletrading.co.uk/" de un archivo HTM, también necesito obtener todo lo que viene después de la URL principal, por ejemplo /blog/name-of-blog etc.
Estoy usando Notepad ++ y Regex para intentar lograr esto, pero estoy luchando. Realmente no entiendo Regex.
Probé algo como esto: .*?(https\:\/\/www\.[a-zA-Z0-9\.\/\-]+)
¿Alguien puede decirme cómo puedo lograr esto?
Recibo una lista de las URL que se marcaron como rotas, así que puedo usarla para configurar redireccionamientos 301.
Aquí está el ARCHIVO HTML si alguien quiere echar un vistazo.
Gracias por adelantado.
Esto es lo que terminé haciendo en su lugar, usando jQuery para capturar las URL que contenían crocodiletrading.co.uk
jQuery( document ).ready( function() { var arr = []; i = 0; jQuery('a[href*="crocodiletrading.co.uk"]').each(function() { arr[i++] = jQuery(this).attr('href'); }); var list = '<ul class="myList"><li class="ui-menu-item" role="menuitem"><a class="ui-all" tabindex="-1">' + arr.join('</a></li><li>') + '</li></ul>'; console.log(list); });Esta función imprime todos los enlaces que están dentro de todas las etiquetas de anclaje (<a href="enlace a alguna página" ></a>)
const getAllLinks = () => { const links = document.querySelectorAll("a"); links.forEach(link => { console.log(link.href); }) }Prueba este código, puede ser útil,
Encuentra: ^[\s\S]+?(https://www.crocodiletrading.co.uk/).*\n*(blog.*\d+).*
Reemplazar todo: $1$2