Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

231
Visualizações
Cómo encontrar una cadena única dentro de html y envolverla con una etiqueta, pero excluir enlaces y URL

Estoy buscando una manera de buscar una cadena específica dentro de una página en el texto visible y luego envolver esa cadena en etiquetas <em> . Intenté usar HTML Agility Pack y tuve cierto éxito con Regex.Replace pero si la cadena se incluye dentro de una URL, también se reemplaza, lo cual no quiero, si está dentro de un nombre de imagen, se reemplaza y esto obviamente rompe el enlace o URL de la imagen.

Un intento de ejemplo:

 var markup = Encoding.UTF8.GetString(buffer); var replaced = Regex.Replace(markup, "product-xs", " <em>product</em>-xs", RegexOptions.IgnoreCase); var output = Encoding.UTF8.GetBytes(replaced); _stream.Write(output, 0, output.Length);

Esto no funciona, ya que reemplazaría un <a href="product/product-xs"> con <a href="product/<em>product</em>-xs"> , que no quiero.

La cadena proviene de un valor de cadena de texto dentro de un CMS, por lo que el usuario no puede envolver las palabras allí e, idealmente, quiero capturar todas las instancias de la palabra que ya están publicadas.

Idealmente, me gustaría excluir las etiquetas <title> , las etiquetas <img> y las etiquetas <a> , todo lo demás debería tener la etiqueta envuelta.

Antes de usar HTML Agility Pack, un compañero desarrollador front-end lo probó con JavaScript, pero eso tuvo un impacto inesperado en los menús desplegables.

Si necesita más información, solo pregunte.

about 4 years ago · Juan Pablo Isaza
1 Respostas
Responde à pergunta

0

Puede usar HTML Agility Pack para seleccionar solo los nodos de texto (es decir, el texto que existe entre dos etiquetas cualesquiera) con un poco de XPath y modificarlos así.

Mirar solo en el cuerpo excluirá <title> , <meta> etc. Las etiquetas de script not excluyen, puede excluir otras de la misma manera (o verificar el nodo principal en el ciclo).

 foreach (HtmlNode node in htmlDoc.DocumentNode.SelectNodes("//body//*[not(self::script)]/text()")) { var newNode = htmlDoc.CreateTextNode(node.InnerText.Replace("product-xs", "<em>product</em>-xs")); node.ParentNode.ReplaceChild(newNode, node); }

He usado un reemplazo simple, la expresión regular también funcionará bien, probablemente sea mejor verificar el rendimiento de cada enfoque y elegir cuál funciona mejor para su caso de uso.

about 4 years ago · Juan Pablo Isaza Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda