Según tengo entendido, la implementación de Web Speech API, especialmente la interfaz SpeechRecognition, es que se basa en los servicios propietarios de los proveedores de cada navegador, por lo que posiblemente Chrome "llame a casa" a la misma infraestructura que impulsa otros servicios de voz de Google, Edge llama a Microsoft, etc. adelante.
He confirmado esto al menos para Chrome, bloqueando todas las conexiones a los dominios de Google y viendo que SpeechRecognition deja de funcionar.
Esto me llevó a dos preguntas para las que no pude encontrar respuestas en ninguna parte:
¿Hay alguna documentación sobre cómo los navegadores llaman a casa para ciertas API? (quizás no limitado a Web Speech)
¿Existe una cuota para las llamadas a los servicios Web Speech? Tanto Google como Microsoft venden reconocimiento de voz y TTS como un servicio, por lo que me sorprendería si prácticamente no hubiera límite para el uso de Web Speech siempre que pase por las llamadas de implementación del navegador nativo.