Subformer
De balde · Sen rexistro · Funciona no teu navegador

Voz a texto gratis en 35+ linguas

Solte calquera ficheiro de audio ou vídeo, escolle unha lingua e obtén unha transcrición completa con marcas de tempo - todo no teu navegador. O modelo descárgase unha vez (~75 MB) e almacénase en caché localmente, polo que as execucións posteriores son instantáneas e funcionan sen conexión.

Privado por defecto

O recoñecemento realízase localmente. O teu áudio nunca sae do teu dispositivo.

Instantáneo despois da primeira carga

O modelo está en caché no teu navegador. As execucións posteriores funcionan sen conexión.

Gratuíto, sen rexistro

Sen conta, sen créditos, sen límite de uso. Abre e usa.

Elixe un idioma

Baixo o capó

O recoñecemento de voz normalmente significa cargar o teu audio á GPU doutra persoa. Aquí o modelo execútase na túa propia máquina, o que fai que a ferramenta sexa gratuíta e privada ao mesmo tempo.

Open-source recognition model
Unha compilación cuantificada dun modelo neural de recoñecemento de voz de código aberto, o suficientemente pequena como para descargar unha vez e manter no teu navegador.
WebAssembly
O tempo de execución da inferencia compílase en WebAssembly, polo que o código numérico se executa a unha velocidade case nativa dentro dunha pestana illada sen complemento nin instalación.
On-device inference
A carga do modelo, a tokenización e a execución do bucle de decodificación ocorren todas no lado do cliente. Ningunha parte da pipeline chama a un servidor unha vez que a páxina se cargou.
Web Audio API
O seu ficheiro decodifícase e remostréase ao mono de 16 kHz que o modelo espera usando a propia canalización de audio do navegador, polo que se acepta calquera formato que o seu navegador poida reproducir.

A desvantaxe é o tamaño do modelo. Os pesos no dispositivo son unha fracción do que executa un servizo aloxado, polo que a precisión diminúe en audio ruidoso, acentos fortes e falantes superpostos; aí é onde a opción na nube de abaixo gaña o seu valor.

Necesitas maior precisión ou máis idiomas?

Conversión de voz a texto baseada na nube

A ferramenta gratuíta no navegador executa un pequeno modelo de código aberto, que está ben para audio limpo, pero pode ter dificultades con acentos fortes, ruído ou falantes superpostos, e só cobre un conxunto limitado de idiomas. Para unha precisión de calidade de emisión, un soporte de idiomas moito máis amplo e descargas SRT/VTT/TXT, utiliza a nosa conversión de voz a texto de pago baseada na nube.

Probar a conversión de voz a texto baseada na nube