Subformer
Gratuit · Fără înscriere · Rulează în browserul tău

Transcriere gratuită din vorbire în 35+ limbi

Plasează orice fișier audio sau video, alege o limbă și obține o transcriere completă cu marcaje de timp - totul în browserul tău. Modelul este descărcat o singură dată (~75 MB) și stocat în cache local, astfel încât rulările ulterioare sunt instantanee și funcționează offline.

Privat implicit

Recunoașterea rulează local. Fișierul tău audio nu părăsește niciodată dispozitivul.

Instant după prima încărcare

Modelul este memorat în cache în browserul tău. Execuțiile ulterioare funcționează offline.

Gratuit, fără înregistrare

Fără cont, fără credite, fără limită de utilizare. Deschideți și folosiți.

Alegeți o limbă

Sub capotă

Recunoașterea vocală înseamnă, în mod normal, încărcarea audio-ului tău pe GPU-ul cuiva. Aici modelul rulează pe propria ta mașină, ceea ce face instrumentul gratuit și privat în același timp.

Open-source recognition model
O versiune cuantificată a unui model neural open-source de recunoaștere vocală, suficient de mică pentru a fi descărcată o singură dată și păstrată în browserul tău.
WebAssembly
Runtime-ul de inferență este compilat în WebAssembly, astfel încât codul numeric rulează la o viteză aproape nativă într-o filă sandbox, fără plugin și fără instalare.
On-device inference
Încărcarea modelului, tokenizarea și rularea buclei de decodare se întâmplă toate pe partea clientului. Nicio parte a pipeline-ului nu apelează un server odată ce pagina a fost încărcată.
Web Audio API
Fișierul dvs. este decodificat și reeșantionat la mono de 16 kHz pe care modelul îl așteaptă, folosind propriul pipeline audio al browserului, astfel încât orice format pe care browserul dvs. îl poate reda este acceptat.

Compromisul este dimensiunea modelului. Ponderile pe dispozitiv reprezintă o fracțiune din ceea ce rulează un serviciu găzduit, astfel încât precizia scade pe audio zgomotos, accente puternice și vorbitori suprapuși – acolo unde opțiunea cloud de mai jos își merită banii.

Aveți nevoie de o precizie mai mare sau de mai multe limbi?

Speech to Text bazat pe cloud

Instrumentul gratuit din browser rulează un model open-source mic - bun pentru audio curat, dar se poate confrunta cu accente puternice, zgomot sau vorbitori suprapuși și acoperă doar un set limitat de limbi. Pentru o precizie de nivel profesional, un suport lingvistic mult mai larg și descărcări SRT/VTT/TXT, utilizați serviciul nostru plătit Speech to Text bazat pe cloud.

Încercați Speech to Text bazat pe cloud