Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

207
Views
Guarde el discurso utilizado para llenar un cuadro de texto después de dictar en (ipad/dispositivo móvil) con teclado-micrófono

Al hacer clic en un cuadro de texto en iPad o dispositivos móviles en un navegador, aparece el teclado en la pantalla. Aquí es posible seleccionar el micrófono para dictar el texto directamente en el cuadro de entrada con nuestra voz sin necesidad de escribir directamente.

Debido a que la conversión del discurso no siempre es perfecta, nos gustaría guardar el audio del discurso en nuestro servidor para usarlo cuando el texto no sea lo suficientemente claro.

¿Es posible recuperar, desde el ipad/móvil, y guardar en nuestro servidor, el audio del discurso que se ha utilizado para escribir el texto en el cuadro de texto?

Sé que podría escribir código javascript para convertir el discurso en texto y grabar la voz directamente, pero nos gustaría saber si es posible obtener el audio (como un archivo) utilizado para la conversión de discurso a texto que utiliza el dispositivo para llenar el cuadro de texto. .

Es decir cuando dicto usando el micrófono, del teclado del dispositivo, ¿el dispositivo permite que la página donde se realizó la cobertura acceda al audio como un archivo?

about 4 years ago · Juan Pablo Isaza
1 answers
Answer question

0

Dado que también etiquetó este Android, no en ese sistema operativo. El teclado es su propia aplicación y maneja la entrada de voz por sí mismo. No hay forma de acceder a los archivos de otra aplicación.

Si desea hacer esto en una aplicación nativa, coloque su propio botón de micrófono y use el servicio de voz a texto, que devolverá una serie de posibles entradas con probabilidades. En un navegador, simplemente no tiene suerte ya que no hay acceso al servicio.

Todo esto es una especie de punto discutible de todos modos por algunas razones

  • Muy pocas personas utilizan la entrada de voz. Mis últimos datos sobre números son antiguos, pero eran lo suficientemente impopulares cuando trabajaba en una empresa de teclados, teníamos la opción de quitar la tecla.
  • Subir esos archivos sería un gran problema de privacidad. Mire la tormenta de fuego hace aproximadamente un año cuando se descubrió que Google/Amazon hizo lo mismo por la misma razón. Este fue un problema mayor en su caso, ya que era un procesamiento en segundo plano, pero es probable que los usuarios aún no estén contentos.
  • A menos que esté gastando unos pocos millones en investigadores, no lo hará mejor que la solución existente. Ese tipo de software no es fácil de escribir, no es un problema totalmente resuelto, ni siquiera por Google y Nuance (propietarios de Dragon que alimenta a Siri, o al menos lo hicieron) que tienen grandes equipos. ¿Por qué crees que lo harás mejor? A menos que planees escucharlos manualmente. En cuyo caso el siguiente punto es aún más grande.
  • Bien, entonces carga el archivo y encuentra una mejor solución. ¿Qué va a hacer al respecto? ¿Cambiar de alguna manera el texto que el usuario escribió hace 20 minutos? ¿Cómo vas a hacer esto y tener un flujo de UX que tenga sentido?
about 4 years ago · Juan Pablo Isaza Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!