Subformer
Gratuït · Sense registre · S'executa al teu navegador

Transcripció de veu gratuïta en més de 35 idiomes

Deixa anar qualsevol fitxer d'àudio o vídeo, tria un idioma i obté una transcripció completa amb marques de temps - tot al teu navegador. El model es descarrega una sola vegada (~75 MB) i s'emmagatzema a la memòria cau local, així que les execucions posteriors són instantànies i funcionen sense connexió.

Privat per defecte

El reconeixement s'executa localment. El teu àudio mai no surt del teu dispositiu.

Instantani després de la primera càrrega

El model es guarda a la memòria cau del teu navegador. Les execucions posteriors funcionen sense connexió.

Gratuït, sense registre

Sense compte, sense crèdits, sense límit d’ús. Obre'l i fes-ne ús.

Tria un idioma

Sota el capó

El reconeixement de veu normalment implica carregar el vostre àudio a la GPU d'algú. Aquí el model s'executa a la vostra pròpia màquina, la qual cosa fa que l'eina sigui gratuïta i privada al mateix temps.

Open-source recognition model
Una versió quantificada d'un model de reconeixement de veu neuronal de codi obert, prou petita per descarregar una vegada i mantenir al navegador.
WebAssembly
El temps d'execució d'inferència es compila a WebAssembly, de manera que el codi numèric s'executa a una velocitat gairebé nativa dins d'una pestanya aïllada sense cap connector ni instal·lació.
On-device inference
La càrrega del model, la tokenització i l'execució del bucle de descodificació es realitzen al costat del client. Cap part del pipeline no fa cap crida a un servidor un cop la pàgina s'ha carregat.
Web Audio API
El vostre fitxer es descodifica i es remostreja a 16 kHz mono, que és el que espera el model, utilitzant la pròpia canalització d'àudio del navegador, de manera que s'accepta qualsevol format que el vostre navegador pugui reproduir.

La contrapartida és la mida del model. Els pesos al dispositiu són una fracció del que executa un servei allotjat, de manera que la precisió disminueix en àudio sorollós, accents forts i parlants superposats; aquí és on l'opció del núvol següent es guanya el seu lloc.

Necessites més precisió o més idiomes?

Reconeixement de veu a text basat en el núvol

L'eina gratuïta al navegador executa un petit model de codi obert, que funciona bé per a àudios nets, però pot tenir dificultats amb accents marcats, soroll o parlants superposats, i només cobreix un conjunt limitat d'idiomes. Per a una precisió de qualitat de difusió, un suport lingüístic molt més ampli i descàrregues SRT/VTT/TXT, utilitza el nostre reconeixement de veu a text de pagament basat en el núvol.

Prova el reconeixement de veu a text basat en el núvol