gracias por leer esta pregunta!
Estamos tratando de crear animaciones simples de, por ejemplo, un personaje de dibujos animados que habla. El desafío es sincronizar varias imágenes que se correspondan con ciertas 'formas de boca' (labios cerrados para un sonido P o B o M, por ejemplo), con algún audio desconocido que potencialmente pronuncie cualquier palabra.
El audio puede estar en cualquier idioma, aunque sabremos en qué idioma es según lo identifique el usuario final. Por lo tanto, el desafío requiere algún tipo de sincronización con el audio sin estar específicamente limitado al inglés u otro idioma específico.
Estaba pensando que podría ser posible asignar una cadena del Alfabeto fonético internacional (IPA) a las imágenes, pero el desafío sigue siendo descubrir cómo asignar de alguna manera el identificador de audio + idioma a la cadena IPA correcta, y luego sincronizar el partes correctas de la cadena a los momentos correctos en el audio.
Si ayuda, también tenemos transcripciones exactas del texto que habla el audio.
Si hay bibliotecas de terceros disponibles para este tipo de cosas, serían bienvenidas, aunque nuestra base de código solo está en JS/TS.
¡Gracias!