Subformer
Grátis · Sem cadastro · Executa no seu navegador

Fala para texto gratuito em 35+ idiomas

Solte qualquer arquivo de áudio ou vídeo, escolha um idioma e obtenha uma transcrição completa com marcações de tempo - tudo no seu navegador. O modelo é baixado uma vez (~75 MB) e fica em cache localmente, então as execuções subsequentes são instantâneas e funcionam offline.

Privado por padrão

O reconhecimento é executado localmente. Seu áudio nunca sai do seu dispositivo.

Instantâneo após o primeiro carregamento

O modelo é armazenado em cache no seu navegador. As execuções subsequentes funcionam offline.

Gratuito, sem cadastro

Sem conta, sem créditos, sem limite de uso. Aberto e pronto para uso.

Escolha um idioma

Nos bastidores

O reconhecimento de fala normalmente significa enviar seu áudio para a GPU de alguém. Aqui, o modelo roda na sua própria máquina, o que torna a ferramenta gratuita e privada ao mesmo tempo.

Open-source recognition model
Uma versão quantizada de um modelo neural de reconhecimento de fala de código aberto, pequena o suficiente para baixar uma vez e manter no seu navegador.
WebAssembly
O tempo de execução de inferência é compilado para WebAssembly, então o código numérico é executado em velocidade quase nativa dentro de uma aba em sandbox, sem plugin e sem instalação.
On-device inference
O carregamento do modelo, a tokenização e a execução do loop de decodificação acontecem todos no lado do cliente. Nenhuma parte do pipeline faz chamadas a um servidor depois que a página é carregada.
Web Audio API
Seu arquivo é decodificado e reamostrado para o mono de 16 kHz que o modelo espera usando o pipeline de áudio do próprio navegador, então qualquer formato que seu navegador possa reproduzir é aceito.

A desvantagem é o tamanho do modelo. Os pesos no dispositivo são uma fração do que um serviço hospedado executa, então a precisão cai em áudios ruidosos, sotaques fortes e falantes sobrepostos - é aí que a opção de nuvem abaixo se justifica.

Precisa de maior precisão ou mais idiomas?

Speech to Text baseado em nuvem

A ferramenta gratuita no navegador executa um pequeno modelo de código aberto - bom para áudio limpo, mas pode ter dificuldades com sotaques fortes, ruído ou falantes sobrepostos, e cobre apenas um conjunto limitado de idiomas. Para precisão de nível profissional, suporte a idiomas muito mais amplo e downloads SRT/VTT/TXT, use nosso Speech to Text pago baseado em nuvem.

Experimentar Speech to Text baseado em nuvem