Suelta cualquier archivo de audio o vídeo, elige un idioma y obtén una transcripción completa con marcas de tiempo - todo en tu navegador. El modelo se descarga una sola vez (~75 MB) y se almacena en caché localmente, por lo que las ejecuciones posteriores son instantáneas y funcionan sin conexión.
El reconocimiento se realiza localmente. Tu audio nunca abandona tu dispositivo.
El modelo se almacena en caché en tu navegador. Las ejecuciones posteriores funcionan sin conexión.
Sin cuenta, sin créditos, sin límite de uso. Ábrelo y úsalo.
El reconocimiento de voz normalmente implica subir tu audio a la GPU de alguien. Aquí el modelo se ejecuta en tu propia máquina, lo que hace que la herramienta sea gratuita y privada al mismo tiempo.
La desventaja es el tamaño del modelo. Los pesos en el dispositivo son una fracción de lo que ejecuta un servicio alojado, por lo que la precisión disminuye en audio ruidoso, acentos fuertes y oradores superpuestos; ahí es donde la opción en la nube a continuación se justifica.
La herramienta gratuita en el navegador ejecuta un pequeño modelo de código abierto, lo cual está bien para audio limpio, pero puede tener dificultades con acentos fuertes, ruido o oradores superpuestos, y solo cubre un conjunto limitado de idiomas. Para una precisión de calidad de emisión, un soporte de idiomas mucho más amplio y descargas SRT/VTT/TXT, utiliza nuestro servicio de Voz a texto de pago basado en la nube.
Probar Voz a texto basado en la nube