Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

233
Vistas
Cómo encontrar una cadena única dentro de html y envolverla con una etiqueta, pero excluir enlaces y URL

Estoy buscando una manera de buscar una cadena específica dentro de una página en el texto visible y luego envolver esa cadena en etiquetas <em> . Intenté usar HTML Agility Pack y tuve cierto éxito con Regex.Replace pero si la cadena se incluye dentro de una URL, también se reemplaza, lo cual no quiero, si está dentro de un nombre de imagen, se reemplaza y esto obviamente rompe el enlace o URL de la imagen.

Un intento de ejemplo:

 var markup = Encoding.UTF8.GetString(buffer); var replaced = Regex.Replace(markup, "product-xs", " <em>product</em>-xs", RegexOptions.IgnoreCase); var output = Encoding.UTF8.GetBytes(replaced); _stream.Write(output, 0, output.Length);

Esto no funciona, ya que reemplazaría un <a href="product/product-xs"> con <a href="product/<em>product</em>-xs"> , que no quiero.

La cadena proviene de un valor de cadena de texto dentro de un CMS, por lo que el usuario no puede envolver las palabras allí e, idealmente, quiero capturar todas las instancias de la palabra que ya están publicadas.

Idealmente, me gustaría excluir las etiquetas <title> , las etiquetas <img> y las etiquetas <a> , todo lo demás debería tener la etiqueta envuelta.

Antes de usar HTML Agility Pack, un compañero desarrollador front-end lo probó con JavaScript, pero eso tuvo un impacto inesperado en los menús desplegables.

Si necesita más información, solo pregunte.

about 4 years ago · Juan Pablo Isaza
1 Respuestas
Responde la pregunta

0

Puede usar HTML Agility Pack para seleccionar solo los nodos de texto (es decir, el texto que existe entre dos etiquetas cualesquiera) con un poco de XPath y modificarlos así.

Mirar solo en el cuerpo excluirá <title> , <meta> etc. Las etiquetas de script not excluyen, puede excluir otras de la misma manera (o verificar el nodo principal en el ciclo).

 foreach (HtmlNode node in htmlDoc.DocumentNode.SelectNodes("//body//*[not(self::script)]/text()")) { var newNode = htmlDoc.CreateTextNode(node.InnerText.Replace("product-xs", "<em>product</em>-xs")); node.ParentNode.ReplaceChild(newNode, node); }

He usado un reemplazo simple, la expresión regular también funcionará bien, probablemente sea mejor verificar el rendimiento de cada enfoque y elegir cuál funciona mejor para su caso de uso.

about 4 years ago · Juan Pablo Isaza Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda