Subformer
Ingyenes · Nincs regisztráció · A böngészőben fut

Ingyenes beszédfelismerés több mint 35 nyelven

Húzzon ide bármilyen hang- vagy videófájlt, válasszon nyelvet, és kapjon teljes átírást időbélyegekkel - mindez a böngészőjében. A modellt egyszer töltjük le (~75 MB), és helyileg gyorsítótárazódik, így a későbbi futtatások azonnaliak és offline is működnek.

Alapértelmezés szerint privát

A felismerés helyileg fut. Az audiofájl soha nem hagyja el az eszközét.

Az első betöltés után azonnali

A modell a böngésződ gyorsítótárában tárolódik. A későbbi futtatások offline is működnek.

Ingyenes, regisztráció nélkül

Nincs fiók, nincsenek kreditek, nincs használati korlát. Nyisd meg és használd.

Válassz egy nyelvet

A háttérben

A beszédfelismerés általában azt jelenti, hogy feltölti a hanganyagát valaki GPU-jára. Itt a modell ehelyett az Ön saját gépén fut, ami ingyenessé és egyben priváttá teszi az eszközt.

Open-source recognition model
Egy nyílt forráskódú neurális beszédfelismerő modell kvantált buildje, elég kicsi ahhoz, hogy egyszer letöltse és a böngészőjében tartsa.
WebAssembly
Az inferencia futtatókörnyezet WebAssembly-re van fordítva, így a numerikus kód közel natív sebességgel fut egy homokozóban lévő lapon, bővítmény és telepítés nélkül.
On-device inference
A modell betöltése, a tokenizálás és a dekódolási ciklus futtatása mind kliensoldalon történik. A folyamat egyetlen része sem hív meg szervert, miután az oldal betöltődött.
Web Audio API
Fájlja dekódolásra és 16 kHz-es monóvá mintavételezésre kerül, amit a modell elvár, a böngésző saját hang-pipeline-jának használatával, így bármilyen formátum elfogadott, amit a böngészője le tud játszani.

A kompromisszum a modell mérete. Az eszközön lévő súlyok töredékei annak, amit egy hosztolt szolgáltatás futtat, így a pontosság csökken zajos hang, erős akcentusok és átfedő beszélők esetén – itt éri meg az alábbi felhőalapú opció.

Nagyobb pontosságra vagy több nyelvre van szüksége?

Felhőalapú beszéd-szöveg átalakítás

Az ingyenes böngészőben futó eszköz egy kis nyílt forráskódú modellt használ – tiszta hanganyag esetén megfelelő, de nehézséget okozhatnak neki az erős akcentusok, a zaj vagy az egymásra beszélő hangok, és csak korlátozott számú nyelvet támogat. A műsorszórási minőségű pontosság, a sokkal szélesebb nyelvi támogatás, valamint az SRT/VTT/TXT letöltések érdekében használja fizetős felhőalapú beszéd-szöveg átalakító szolgáltatásunkat.

Próbálja ki a felhőalapú beszéd-szöveg átalakítást