Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

813
Views
Súper resolución de imagen de texto de escena para OCR

Estoy trabajando en un sistema OCR. Un desafío al que me enfrento para reconocer el texto dentro del ROI se debe a la inestabilidad o la toma con efecto de movimiento o al texto que no está enfocado debido a las posiciones del ángulo . Considere la siguiente muestra de demostración

ingrese la descripción de la imagen aquí

Si observa los textos (por ejemplo, la marca en rojo), en tales casos el sistema OCR no podría reconocer correctamente el texto. Sin embargo, este escenario también puede ocurrir sin un ángulo de disparo donde la imagen es demasiado borrosa para que el sistema OCR no pueda reconocer o reconocer parcialmente el texto. A veces son borrosas oa veces de muy baja resolución o pixeladas . Por ejemplo

ingrese la descripción de la imagen aquí

Métodos que hemos probado

En primer lugar, hemos probado varios métodos disponibles en SO. Pero lamentablemente no hubo suerte.

  • Cómo mejorar la calidad de la imagen para extraer texto de la imagen usando Tesseract
  • ¿Cómo mejorar la calidad de la imagen? [cerrado]
  • Mejora de la calidad de imagen en Opencv

A continuación, hemos probado los siguientes tres métodos más prometedores como se muestra a continuación.

1.TSRN

Un trabajo de investigación reciente ( TSRN ) se centra principalmente en estos casos. Lo más intuitivo es introducir técnicas de superresolución (SR) como preprocesamiento. Esta implementación parece, con mucho, la más prometedora. Sin embargo, no logra hacer magia en nuestro conjunto de datos personalizado (por ejemplo, las segundas imágenes de arriba, el texto azul). Aquí hay algunos ejemplos de su demostración:

ingrese la descripción de la imagen aquí

2. Mejora neuronal

Después de ver su ilustración en su página , creímos que podría funcionar. Pero, lamentablemente, tampoco pudo abordar el problema. Sin embargo, estaba un poco confuso incluso con su ejemplo mostrado porque no podía reproducirlos también. He planteado un problema en github donde demostré esto con más detalle. Aquí hay algunos ejemplos de su demostración:

ingrese la descripción de la imagen aquí

3. RSI

La última opción con mínima esperanza con esta implementación. Tampoco suerte.

Actualización 1

  • [Método]: además de lo anterior, también probamos algunos enfoques tradicionales, como el filtro de desenfoque fuera de foco (filtro Wiener y también filtro Weiner no supervisado). También verificamos el método de Richardson-Lucy . pero tampoco mejora con este enfoque.

  • [Método]: Probamos una solución DeBlur basada en GAN. DeblurGAN He probado esta red. Lo que me atrajo fue el enfoque del mecanismo Blind Motion Deblurring .

Por último, de esta discusión nos encontramos con este trabajo de investigación que parece bastante bueno. No probé esto todavía.

ingrese la descripción de la imagen aquí

Actualización 2

  1. [Método]: superresolución del mundo real a través de la estimación del kernel y la inyección de ruido Probé este método. Prometedor. Sin embargo, no funcionó en nuestro caso. código

  2. [Método]: Restauración de fotos En comparación con todos los métodos anteriores, sorprendentemente tiene el mejor rendimiento en resolución de supertexto para OCR. Elimina en gran medida el ruido, la borrosidad, etc., y hace que la imagen sea mucho más clara y mejore la generalización del modelo. código

Mi Consulta

¿Existe alguna solución eficaz para abordar estos casos? ¿Algún método que pueda mejorar esos píxeles borrosos o de baja resolución, ya sea que los textos estén al frente o lejos debido al ángulo de la cámara?

over 4 years ago · Hanz Gallego
1 answers
Answer question

0

Actualmente, existe una solución Real-World Super-Resolution a través de la estimación del kernel y la inyección de ruido . El autor propone un marco de degradación RealSR, que proporciona imágenes realistas para el aprendizaje de superresolución. Es un método prometedor para superresolución de imágenes con efectos de movimiento o temblores.

El método se divide en dos etapas. La primera etapa Degradación realista para superresolución

es estimar la degradación a partir de datos reales y generar imágenes LR realistas.

El modelo de superresolución de segunda etapa

es entrenar el modelo SR en base a los datos construidos.

Puede consultar este artículo de Github: https://github.com/jixiaozhong/RealSR

over 4 years ago · Hanz Gallego Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!