Estoy interesado en hacer un verificador simple que reciba un PDF como entrada y busque si ese PDF está etiquetado para lectores de pantalla. Esta información no está disponible en los metadatos. ¿Alguien sabe/puede indicarme la dirección correcta, si hacer esto es posible con JavaScript, posiblemente con PDF.js?
¡Gracias!
Hay archivos PDF que contienen objetos con etiquetas que se pueden leer en pantalla sin las etiquetas y hay archivos PDF con etiquetas que no se pueden leer en pantalla y también archivos PDF etiquetados correctamente que cumplen completamente con todos los requisitos de PDF/UA o PDF/A-2.
Por lo tanto, para la lectura de pantalla no debería tener sentido buscar etiquetas simplistas o etiquetas que no sean para probar que el archivo pasa la prueba para usar un verificador de conformidad.
Desde iText
Si tiene un documento que tiene una imagen de un zorro y un perro, iText no puede agregar ningún texto alternativo faltante para esas imágenes, porque iText no puede ver ese zorro ni ese perro.
Los objetos PDF se pueden encriptar o codificar, por lo que no siempre son fáciles de detectar como una estructura simple; sin embargo, algunos datos no deben codificarse. Si tiene suerte, los metadatos no codificados pueden incluir la cadena pdfua o PDF/UA, lo que no prueba la conformidad solo como un intento. También tenga cuidado con cualquier archivo etiquetado que tenga un artículo sobre la producción de PDF/UA pero no lo sea :-) 