Tengo un fragmento de código que intenta encontrar direcciones URL y las envuelve en etiquetas <a> . Funciona bien para cadenas más cortas, pero en cadenas más largas no funciona en absoluto. ¿Alguien sabe por qué?
function urlify(text) { var urlRegex = `/(([az]+:\/\/)?(([a-z0-9\-]+\.)+([az]{2}|aero|arpa|biz|com|coop|edu|gov|info|int|jobs|mil|museum|name|nato|net|org|pro|travel|local|internal))(:[0-9]{1,5})?(\/[a-z0-9_\-\.~]+)*(\/([a-z0-9_\-\.]*)(\?[a-z0-9+_\-\.%=&]*)?)?(#[a-zA-Z0-9!$&'()*+.=-_~:@/?]*)?)(\s+|$)/gi` return text.replace(urlRegex, function(url) { return '<a href="' + url + '">' + url + '</a>'; }); } Si ejecuto urlify('www.example.com is a cool website') devuelve <a href="www.example.com">www.example.com</a> is a cool website pero si tengo una cadena que tiene 5000 caracteres que tiene enlaces, no cambia la cadena original en absoluto.
Aquí hay una versión más eficiente de la misma expresión regular:
function urlify(text) { var urlRegex = /(?:[az]+:\/\/)?(?:[az\d-]+\.)+(?:a(?:ero|rpa)|biz|co(?:m|op)|edu|gov|in(?:ternal|fo|t)|jobs|m(?:il|useum)|n(?:a(?:me|to)|et)|org|pro|travel|local|[az]{2})(?::\d{1,5})?(?:\/[\w.~-]+)*(?:\/[\w.-]*(?:\?[\w+.%=&;-]*)?)?(?:#[\w!$&'()*+.=~:@\/?-]*)?(?!\S)/gi return text.replace(urlRegex, '<a href="$&">$&</a>'); }Vea la demostración de expresiones regulares .
La parte que es difícil de optimizar en este momento es el inicio (?:[az]+:\/\/)?(?:[az\d-]+\.)+ , ya que esto permite hacer coincidir el patrón de longitud desconocida en cualquier parte de la cadena, y esto implica bastante sobrecarga. Si solo quisiera comenzar a hacer coincidir desde un espacio en blanco o el comienzo de una cadena, un (?<!\S) al comienzo aceleraría en gran medida la coincidencia.