Estoy trabajando en un sistema OCR. Un desafío al que me enfrento para reconocer el texto dentro del ROI se debe a la inestabilidad o la toma con efecto de movimiento o al texto que no está enfocado debido a las posiciones del ángulo . Considere la siguiente muestra de demostración
Si observa los textos (por ejemplo, la marca en rojo), en tales casos el sistema OCR no podría reconocer correctamente el texto. Sin embargo, este escenario también puede ocurrir sin un ángulo de disparo donde la imagen es demasiado borrosa para que el sistema OCR no pueda reconocer o reconocer parcialmente el texto. A veces son borrosas oa veces de muy baja resolución o pixeladas . Por ejemplo
En primer lugar, hemos probado varios métodos disponibles en SO. Pero lamentablemente no hubo suerte.
A continuación, hemos probado los siguientes tres métodos más prometedores como se muestra a continuación.
1.TSRN
Un trabajo de investigación reciente ( TSRN ) se centra principalmente en estos casos. Lo más intuitivo es introducir técnicas de superresolución (SR) como preprocesamiento. Esta implementación parece, con mucho, la más prometedora. Sin embargo, no logra hacer magia en nuestro conjunto de datos personalizado (por ejemplo, las segundas imágenes de arriba, el texto azul). Aquí hay algunos ejemplos de su demostración:
2. Mejora neuronal
Después de ver su ilustración en su página , creímos que podría funcionar. Pero, lamentablemente, tampoco pudo abordar el problema. Sin embargo, estaba un poco confuso incluso con su ejemplo mostrado porque no podía reproducirlos también. He planteado un problema en github donde demostré esto con más detalle. Aquí hay algunos ejemplos de su demostración:
3. RSI
La última opción con mínima esperanza con esta implementación. Tampoco suerte.
[Método]: además de lo anterior, también probamos algunos enfoques tradicionales, como el filtro de desenfoque fuera de foco (filtro Wiener y también filtro Weiner no supervisado). También verificamos el método de Richardson-Lucy . pero tampoco mejora con este enfoque.
[Método]: Probamos una solución DeBlur basada en GAN. DeblurGAN He probado esta red. Lo que me atrajo fue el enfoque del mecanismo Blind Motion Deblurring .
Por último, de esta discusión nos encontramos con este trabajo de investigación que parece bastante bueno. No probé esto todavía.
[Método]: superresolución del mundo real a través de la estimación del kernel y la inyección de ruido Probé este método. Prometedor. Sin embargo, no funcionó en nuestro caso. código
[Método]: Restauración de fotos En comparación con todos los métodos anteriores, sorprendentemente tiene el mejor rendimiento en resolución de supertexto para OCR. Elimina en gran medida el ruido, la borrosidad, etc., y hace que la imagen sea mucho más clara y mejore la generalización del modelo. código
¿Existe alguna solución eficaz para abordar estos casos? ¿Algún método que pueda mejorar esos píxeles borrosos o de baja resolución, ya sea que los textos estén al frente o lejos debido al ángulo de la cámara?
Actualmente, existe una solución Real-World Super-Resolution a través de la estimación del kernel y la inyección de ruido . El autor propone un marco de degradación RealSR, que proporciona imágenes realistas para el aprendizaje de superresolución. Es un método prometedor para superresolución de imágenes con efectos de movimiento o temblores.
El método se divide en dos etapas. La primera etapa Degradación realista para superresolución
es estimar la degradación a partir de datos reales y generar imágenes LR realistas.
El modelo de superresolución de segunda etapa
es entrenar el modelo SR en base a los datos construidos.
Puede consultar este artículo de Github: https://github.com/jixiaozhong/RealSR