Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

225
Visualizações
¿Necesito hacer alguna limpieza de texto para Spacy NER?

Soy nuevo en NER y Spacy . Tratando de averiguar qué limpieza de texto, si es que hay alguna, debe hacerse. Parece que algunos ejemplos que he encontrado recortan los espacios en blanco iniciales y finales y luego los borran con los índices de inicio/detención. Vi un ejemplo en el que el tipo hizo un montón de limpieza y su precisión fue realmente mala porque todos los índices estaban en mal estado.

Solo para aclarar, el conjunto de datos se anotó con DataTurks, por lo que obtienes json como este:

 "Content": <original text> "label": [ "Skills" ], "points": [ { "start": 1295, "end": 1621, "text": "\n• Programming language...

Entonces, al "jugar con los índices", quiero decir, si elimina el \n inicial, debe actualizar el índice de inicio, por lo que aún está alineado correctamente.

Esa es realmente la pregunta, si empiezo a eliminar caracteres desde el principio, el final o el medio, necesito aplicar la regla al atributo de contenido y ajustar los índices de inicio/final para que coincidan, ¿no? Supongo que un "sí" obvio :), así que me preguntaba cuánta limpieza se necesita hacer.

Entonces, ¿eliminaría los \n s, las viñetas, los espacios en blanco iniciales / finales, pero dejaría la puntuación estándar como comas, puntos, etc.?

¿Qué pasa con cosas como minúsculas, palabras vacías, lematización, etc.?

Una preocupación que veo con algunas muestras que he visto es que los índices de inicio/parada se ven afectados por la limpieza que hacen porque es necesario actualizar CADA anotación a medida que elimina caracteres para mantenerlos sincronizados.

Es decir

 A 0 -> 100 B 101 -> 150

si elimino un char en la position 50 , entonces necesito ajustar B to 100 -> 149 .

over 4 years ago · Santiago Trujillo
1 Respostas
Responde à pergunta

0

En primer lugar, spaCy no transforma la entrada: la toma literalmente tal cual y conserva el formato. Por lo tanto, no pierde ninguna información cuando proporciona texto a spaCy.

Dicho esto, la entrada a spaCy con las canalizaciones preentrenadas funcionará mejor si está en oraciones naturales sin puntuación extraña, como un artículo de periódico, porque así es como se ven los datos de entrenamiento de spaCy.

Con ese fin, debe eliminar los espacios en blanco sin sentido (como líneas nuevas, espacios iniciales y finales) o los caracteres de formato (¿quizás una línea de ---- ?), pero eso es todo lo que tiene que limpiar. Los datos de entrenamiento de spaCy no tendrán viñetas, por lo que podrían obtener algunos resultados extraños, pero los dejaría para comenzar. (Además, las viñetas son obviamente caracteres imprimibles, ¿quizás te refieres a no ASCII?)

No tengo idea de lo que quiere decir con "ensuciar con los índices", pero para algunos métodos antiguos de NLP era común hacer un preprocesamiento más extenso, como eliminar palabras vacías y poner todo en minúsculas. Hacer eso empeorará las cosas con spaCy porque usa la información que está eliminando como pistas, tal como lo haría un lector humano.

Tenga en cuenta que puede entrenar sus propios modelos, en cuyo caso aprenderán sobre el tipo de texto que les muestra. En ese caso, puede deshacerse del preprocesamiento por completo, aunque para cosas realmente sin sentido como líneas nuevas / espacios iniciales y posteriores, también podría eliminarlos de todos modos.


Para abordar su nueva información brevemente...

Sí, los índices de caracteres para las etiquetas NER deben actualizarse si realiza un preprocesamiento. Si no están actualizados, no se pueden utilizar.

Parece que está tratando de extraer "habilidades" de un currículum. Eso tiene muchas listas de viñetas. Los datos de entrenamiento de spaCy son artículos de periódicos, que no contienen ninguna lista como esa, por lo que es difícil decir qué es lo correcto. No creo que las balas importen mucho, pero puedes intentar quitarlas o no quitarlas.

¿Qué pasa con cosas como minúsculas, palabras vacías, lematización, etc.?

Ya abordé esto, pero no lo hagas . Históricamente, esta era una práctica común para los modelos NLP, pero para los modelos neuronales modernos, incluido spaCy, es activamente inútil.

over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda