Estoy usando la biblioteca ORC tesseract.js para leer lo que está escrito en una imagen y escribirlo en la consola o en un archivo de texto, así que encontré esta biblioteca y funciona con palabras o caracteres en inglés, pero cuando traté de leer lo que está escrito en la imagen en idioma árabe no funciona, así que esta es la imagen que estoy tratando de leer
y este es mi codigo :-
Etiqueta principal: -
<script src='https://unpkg.com/tesseract.js@v2.1.0/dist/tesseract.min.js'</script>Etiqueta del cuerpo: -
<script> Tesseract.recognize( 'image.png', 'ara', { logger: m => console.log(m) } ).then(({ data: { text } }) => { }) </script>Debe manejar el resultado dentro del bloque .then() .
Aquí hay un ejemplo de trabajo :
<!DOCTYPE html> <meta charset="utf-8"> <title> OCR TEST </title> <script src="https://unpkg.com/tesseract.js@v2.1.0/dist/tesseract.min.js"></script> <output id="result">Processing...</output> <script> const output = document.querySelector('output#result'); Tesseract.recognize( 'https://i.imgur.com/mdzmK4w.png', 'ara' ).then(result => { output.value = result.data.text; }).catch(err => { output.value = 'Processing Failed'; console.log(err); }); </script>El procesamiento puede demorar un tiempo, especialmente en la primera carga porque el módulo WASM y los datos de capacitación de OCR se obtendrán primero en segundo plano. Puede ver que esto sucede en la pestaña Red de sus herramientas de desarrollo.