Solte qualquer arquivo de áudio ou vídeo, escolha um idioma e obtenha uma transcrição completa com marcações de tempo - tudo no seu navegador. O modelo é baixado uma vez (~75 MB) e fica em cache localmente, então as execuções subsequentes são instantâneas e funcionam offline.
O reconhecimento é executado localmente. Seu áudio nunca sai do seu dispositivo.
O modelo é armazenado em cache no seu navegador. As execuções subsequentes funcionam offline.
Sem conta, sem créditos, sem limite de uso. Aberto e pronto para uso.
O reconhecimento de fala normalmente significa enviar seu áudio para a GPU de alguém. Aqui, o modelo roda na sua própria máquina, o que torna a ferramenta gratuita e privada ao mesmo tempo.
A desvantagem é o tamanho do modelo. Os pesos no dispositivo são uma fração do que um serviço hospedado executa, então a precisão cai em áudios ruidosos, sotaques fortes e falantes sobrepostos - é aí que a opção de nuvem abaixo se justifica.
A ferramenta gratuita no navegador executa um pequeno modelo de código aberto - bom para áudio limpo, mas pode ter dificuldades com sotaques fortes, ruído ou falantes sobrepostos, e cobre apenas um conjunto limitado de idiomas. Para precisão de nível profissional, suporte a idiomas muito mais amplo e downloads SRT/VTT/TXT, use nosso Speech to Text pago baseado em nuvem.
Experimentar Speech to Text baseado em nuvem