Subformer
Libre · Walang pagpaparehistro · Tumatakbo sa iyong browser

Libreng English Pagsasalita-sa-Teksto

English

I-drop ang English audio o video file at makakuha ng buong transcript na may timestamps - lahat sa iyong browser, walang signup. Ang modelo ay din-download nang isang beses (~75 MB) at naka-cache nang lokal, kaya ang mga susunod na pagtakbo ay instant at gumagana offline.

Tinitingnan ang suporta ng browser…

Kailangan ng mas mataas na katumpakan o mas maraming wika?

Cloud-based English Speech to Text

Ang libreng in-browser na tool ay gumagamit ng maliit na open-source na modelo - mainam para sa malinis na audio, ngunit maaari itong mahirapan sa malakas na English accent, ingay, o magkakapatong na nagsasalita, at sumasaklaw lamang sa limitadong hanay ng mga wika. Para sa katumpakan na pang-broadcast-grade, mas malawak na suporta sa wika, at mga pag-download ng SRT/VTT/TXT, gamitin ang aming bayad na cloud-based Speech to Text.

Subukan ang cloud-based Speech to Text

Paano ito gumagana

  1. 1. I-drop ang isang file

    I-drop ang anumang English audio o video - sinusuportahan ang MP3, WAV, M4A, MP4, at WEBM.

  2. 2. I-transcribe

    Sa unang pag-click ida-download ang modelong ~75 MB sa iyong browser. Pagkatapos nito, instant ang pagkilala at kaya nitong gumana nang offline.

  3. 3. I-download

    I-save ang transcript bilang TXT, SRT, o VTT. Hindi umaalis ang iyong audio at ang resulta sa iyong aparato.

Mananatili ang iyong audio sa iyong device

Ang pagkilala ay tumatakbo nang buo sa iyong browser gamit ang WebAssembly. Ang tanging mga network request ay para kunin ang modelo at ang WebAssembly runtime - pareho silang pampublikong, static na asset. Hindi namin nakikita ang iyong audio at hindi rin namin nakikita ang transcript.

Paano tumatakbo ang English transcription sa iyong browser

Ang speech recognition ay karaniwang nangangahulugang pag-upload ng iyong audio sa GPU ng ibang tao. Dito, ang model ay tumatakbo sa iyong sariling makina, na siyang dahilan kung bakit libre at pribado ito nang sabay.

Open-source recognition model
Isang open-source neural model na sinanay sa multilingual audio - kaya naman isang download lang ang humahawak sa English nang walang language-specific na model na kukunin.
WebAssembly
Ang inference runtime ay naka-compile sa WebAssembly, kaya ang numerical code ay tumatakbo sa halos native speed sa loob ng isang sandboxed tab nang walang plugin at walang install.
On-device inference
Ang ~75 MB quantized model ay na-load at ang decoding loop ay ganap na pinapatakbo sa client-side. Walang bahagi ng pipeline ang tumatawag sa server kapag na-load na ang pahina.
Web Audio API
Ang iyong file ay dina-decode at ni-resample sa 16 kHz mono na inaasahan ng modelo gamit ang sariling audio pipeline ng browser, kaya anumang format na kayang i-play ng iyong browser ay tinatanggap.
Premium - mula rin sa Subformer

Mga Madalas na Tanong

Subukan ang iba pang libreng mga wika para sa speech-to-text