Digamos que estoy creando una aplicación tipo youtube y quiero crear subtítulos generados automáticamente. Tengo el archivo de video .mp4 y quiero generar un archivo .vtt para eso. ¿Hay alguna forma de hacerlo solo con la API SpeechRecognition y VTTCue s? ¿De alguna manera obtengo los datos de audio del mp4, los ejecuto a través de la API de reconocimiento de voz y genera una transcripción?
Hasta ahora, lo que he visto es que la API SpeechRecognition solo puede transcribir la salida del micrófono en vivo. Pero, ¿hay alguna manera de hacer que se ejecute a través de datos de audio?
Si esto ayuda, estoy usando react en mi interfaz y node en mi backend.
No estoy seguro de acceder directamente a Speech API, pero con Speech SDK puede enviar datos de audio binarios directamente al reconocedor.
Mira esto
y
Todo lo que tienes que hacer es crear tu audioConfig como
var audioConfig = AudioConfig.FromWavFileInput("PathToFile.wav");o
var audioConfig = AudioConfig.FromStreamInput(audioInputStream);en vez de
var audioConfig = AudioConfig.FromDefaultMicrophoneInput();Si el problema es leer un mp4, nAudio debería poder hacerlo: https://github.com/naudio/NAudio