Subformer
Gratis · Sin registro · Se ejecuta en tu navegador

Voz a texto gratuita en 35+ idiomas

Suelta cualquier archivo de audio o vídeo, elige un idioma y obtén una transcripción completa con marcas de tiempo - todo en tu navegador. El modelo se descarga una sola vez (~75 MB) y se almacena en caché localmente, por lo que las ejecuciones posteriores son instantáneas y funcionan sin conexión.

Privado por defecto

El reconocimiento se realiza localmente. Tu audio nunca abandona tu dispositivo.

Instantáneo después de la primera carga

El modelo se almacena en caché en tu navegador. Las ejecuciones posteriores funcionan sin conexión.

Gratis, sin registro

Sin cuenta, sin créditos, sin límite de uso. Ábrelo y úsalo.

Elige un idioma

Bajo el capó

El reconocimiento de voz normalmente implica subir tu audio a la GPU de alguien. Aquí el modelo se ejecuta en tu propia máquina, lo que hace que la herramienta sea gratuita y privada al mismo tiempo.

Open-source recognition model
Una compilación cuantificada de un modelo neuronal de reconocimiento de voz de código abierto, lo suficientemente pequeño como para descargarlo una vez y mantenerlo en tu navegador.
WebAssembly
El tiempo de ejecución de inferencia se compila a WebAssembly, por lo que el código numérico se ejecuta a una velocidad casi nativa dentro de una pestaña aislada sin complementos ni instalación.
On-device inference
La carga del modelo, la tokenización y la ejecución del bucle de decodificación ocurren todas del lado del cliente. Ninguna parte de la tubería llama a un servidor una vez que la página se ha cargado.
Web Audio API
Su archivo se decodifica y remuestrea a los 16 kHz mono que el modelo espera utilizando la propia canalización de audio del navegador, por lo que se acepta cualquier formato que su navegador pueda reproducir.

La desventaja es el tamaño del modelo. Los pesos en el dispositivo son una fracción de lo que ejecuta un servicio alojado, por lo que la precisión disminuye en audio ruidoso, acentos fuertes y oradores superpuestos; ahí es donde la opción en la nube a continuación se justifica.

¿Necesitas mayor precisión o más idiomas?

Voz a texto basado en la nube

La herramienta gratuita en el navegador ejecuta un pequeño modelo de código abierto, lo cual está bien para audio limpio, pero puede tener dificultades con acentos fuertes, ruido o oradores superpuestos, y solo cubre un conjunto limitado de idiomas. Para una precisión de calidad de emisión, un soporte de idiomas mucho más amplio y descargas SRT/VTT/TXT, utiliza nuestro servicio de Voz a texto de pago basado en la nube.

Probar Voz a texto basado en la nube