Solte calquera ficheiro de audio ou vídeo, escolle unha lingua e obtén unha transcrición completa con marcas de tempo - todo no teu navegador. O modelo descárgase unha vez (~75 MB) e almacénase en caché localmente, polo que as execucións posteriores son instantáneas e funcionan sen conexión.
O recoñecemento realízase localmente. O teu áudio nunca sae do teu dispositivo.
O modelo está en caché no teu navegador. As execucións posteriores funcionan sen conexión.
Sen conta, sen créditos, sen límite de uso. Abre e usa.
O recoñecemento de voz normalmente significa cargar o teu audio á GPU doutra persoa. Aquí o modelo execútase na túa propia máquina, o que fai que a ferramenta sexa gratuíta e privada ao mesmo tempo.
A desvantaxe é o tamaño do modelo. Os pesos no dispositivo son unha fracción do que executa un servizo aloxado, polo que a precisión diminúe en audio ruidoso, acentos fortes e falantes superpostos; aí é onde a opción na nube de abaixo gaña o seu valor.
A ferramenta gratuíta no navegador executa un pequeno modelo de código aberto, que está ben para audio limpo, pero pode ter dificultades con acentos fortes, ruído ou falantes superpostos, e só cobre un conxunto limitado de idiomas. Para unha precisión de calidade de emisión, un soporte de idiomas moito máis amplo e descargas SRT/VTT/TXT, utiliza a nosa conversión de voz a texto de pago baseada na nube.
Probar a conversión de voz a texto baseada na nube