Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

230
Views
Cómo encontrar una cadena única dentro de html y envolverla con una etiqueta, pero excluir enlaces y URL

Estoy buscando una manera de buscar una cadena específica dentro de una página en el texto visible y luego envolver esa cadena en etiquetas <em> . Intenté usar HTML Agility Pack y tuve cierto éxito con Regex.Replace pero si la cadena se incluye dentro de una URL, también se reemplaza, lo cual no quiero, si está dentro de un nombre de imagen, se reemplaza y esto obviamente rompe el enlace o URL de la imagen.

Un intento de ejemplo:

 var markup = Encoding.UTF8.GetString(buffer); var replaced = Regex.Replace(markup, "product-xs", " <em>product</em>-xs", RegexOptions.IgnoreCase); var output = Encoding.UTF8.GetBytes(replaced); _stream.Write(output, 0, output.Length);

Esto no funciona, ya que reemplazaría un <a href="product/product-xs"> con <a href="product/<em>product</em>-xs"> , que no quiero.

La cadena proviene de un valor de cadena de texto dentro de un CMS, por lo que el usuario no puede envolver las palabras allí e, idealmente, quiero capturar todas las instancias de la palabra que ya están publicadas.

Idealmente, me gustaría excluir las etiquetas <title> , las etiquetas <img> y las etiquetas <a> , todo lo demás debería tener la etiqueta envuelta.

Antes de usar HTML Agility Pack, un compañero desarrollador front-end lo probó con JavaScript, pero eso tuvo un impacto inesperado en los menús desplegables.

Si necesita más información, solo pregunte.

about 4 years ago · Juan Pablo Isaza
1 answers
Answer question

0

Puede usar HTML Agility Pack para seleccionar solo los nodos de texto (es decir, el texto que existe entre dos etiquetas cualesquiera) con un poco de XPath y modificarlos así.

Mirar solo en el cuerpo excluirá <title> , <meta> etc. Las etiquetas de script not excluyen, puede excluir otras de la misma manera (o verificar el nodo principal en el ciclo).

 foreach (HtmlNode node in htmlDoc.DocumentNode.SelectNodes("//body//*[not(self::script)]/text()")) { var newNode = htmlDoc.CreateTextNode(node.InnerText.Replace("product-xs", "<em>product</em>-xs")); node.ParentNode.ReplaceChild(newNode, node); }

He usado un reemplazo simple, la expresión regular también funcionará bien, probablemente sea mejor verificar el rendimiento de cada enfoque y elegir cuál funciona mejor para su caso de uso.

about 4 years ago · Juan Pablo Isaza Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!