Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

212
Vistas
Guarde el discurso utilizado para llenar un cuadro de texto después de dictar en (ipad/dispositivo móvil) con teclado-micrófono

Al hacer clic en un cuadro de texto en iPad o dispositivos móviles en un navegador, aparece el teclado en la pantalla. Aquí es posible seleccionar el micrófono para dictar el texto directamente en el cuadro de entrada con nuestra voz sin necesidad de escribir directamente.

Debido a que la conversión del discurso no siempre es perfecta, nos gustaría guardar el audio del discurso en nuestro servidor para usarlo cuando el texto no sea lo suficientemente claro.

¿Es posible recuperar, desde el ipad/móvil, y guardar en nuestro servidor, el audio del discurso que se ha utilizado para escribir el texto en el cuadro de texto?

Sé que podría escribir código javascript para convertir el discurso en texto y grabar la voz directamente, pero nos gustaría saber si es posible obtener el audio (como un archivo) utilizado para la conversión de discurso a texto que utiliza el dispositivo para llenar el cuadro de texto. .

Es decir cuando dicto usando el micrófono, del teclado del dispositivo, ¿el dispositivo permite que la página donde se realizó la cobertura acceda al audio como un archivo?

about 4 years ago · Juan Pablo Isaza
1 Respuestas
Responde la pregunta

0

Dado que también etiquetó este Android, no en ese sistema operativo. El teclado es su propia aplicación y maneja la entrada de voz por sí mismo. No hay forma de acceder a los archivos de otra aplicación.

Si desea hacer esto en una aplicación nativa, coloque su propio botón de micrófono y use el servicio de voz a texto, que devolverá una serie de posibles entradas con probabilidades. En un navegador, simplemente no tiene suerte ya que no hay acceso al servicio.

Todo esto es una especie de punto discutible de todos modos por algunas razones

  • Muy pocas personas utilizan la entrada de voz. Mis últimos datos sobre números son antiguos, pero eran lo suficientemente impopulares cuando trabajaba en una empresa de teclados, teníamos la opción de quitar la tecla.
  • Subir esos archivos sería un gran problema de privacidad. Mire la tormenta de fuego hace aproximadamente un año cuando se descubrió que Google/Amazon hizo lo mismo por la misma razón. Este fue un problema mayor en su caso, ya que era un procesamiento en segundo plano, pero es probable que los usuarios aún no estén contentos.
  • A menos que esté gastando unos pocos millones en investigadores, no lo hará mejor que la solución existente. Ese tipo de software no es fácil de escribir, no es un problema totalmente resuelto, ni siquiera por Google y Nuance (propietarios de Dragon que alimenta a Siri, o al menos lo hicieron) que tienen grandes equipos. ¿Por qué crees que lo harás mejor? A menos que planees escucharlos manualmente. En cuyo caso el siguiente punto es aún más grande.
  • Bien, entonces carga el archivo y encuentra una mejor solución. ¿Qué va a hacer al respecto? ¿Cambiar de alguna manera el texto que el usuario escribió hace 20 minutos? ¿Cómo vas a hacer esto y tener un flujo de UX que tenga sentido?
about 4 years ago · Juan Pablo Isaza Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda