Subformer
Libre · Walang signup · Tumatakbo sa iyong browser

Libreng Mandarin Pagsasalita-sa-Teksto

中文

I-drop ang Mandarin na audio o video file at makakuha ng buong transcript na may timestamps - lahat sa iyong browser, walang signup. Ang modelo ay dine-download nang isang beses (~75 MB) at naka-cache nang lokal, kaya ang mga susunod na pagpapatakbo ay instant at gumagana offline.

Sinusuri ang suporta ng browser…

Kailangan ng mas mataas na katumpakan o mas maraming wika?

Cloud-based Mandarin Speech to Text

Ang libreng in-browser tool ay gumagamit ng maliit na open-source model - mainam para sa malinis na audio, ngunit maaari itong mahirapan sa malakas na Mandarin accent, ingay, o magkakapatong na nagsasalita, at sumasaklaw lamang sa limitadong hanay ng mga wika. Para sa broadcast-grade na katumpakan, mas malawak na suporta sa wika, at mga pag-download ng SRT/VTT/TXT, gamitin ang aming bayad na cloud-based Speech to Text.

Subukan ang cloud-based Speech to Text

Paano ito gumagana

  1. 1. Mag-drop ng isang file

    I-drop ang anumang Mandarin audio o video - sinusuportahan ang MP3, WAV, M4A, MP4, at WEBM.

  2. 2. I-transcribe

    Sa unang pag-click ay dine-download ang ~75 MB na modelo sa iyong browser. Pagkatapos nito, instant ang pagkilala at kayang gumana nang offline.

  3. 3. I-download

    I-save ang transcript bilang TXT, SRT, o VTT. Ang iyong audio at ang resulta ay hindi umaalis sa iyong aparato.

Nananatili ang iyong audio sa iyong device

Ang pagkilala ay tumatakbo nang buo sa iyong browser gamit ang WebAssembly. Ang tanging mga network request ay para kunin ang modelo at ang WebAssembly runtime - pareho silang pampublikong, static na asset. Hindi namin nakikita ang iyong audio at hindi rin namin nakikita ang transcript.

Paano tumatakbo ang Mandarin transcription sa iyong browser

Ang speech recognition ay karaniwang nangangahulugang pag-upload ng iyong audio sa GPU ng ibang tao. Dito, ang model ay tumatakbo sa iyong sariling makina, na siyang dahilan kung bakit libre at pribado ito nang sabay.

Open-source recognition model
Isang open-source neural model na sinanay sa multilingual audio - kaya naman isang download lang ang humahawak sa Mandarin nang walang modelong partikular sa wika na kukunin.
WebAssembly
Ang inference runtime ay naka-compile sa WebAssembly, kaya ang numerical code ay tumatakbo sa halos native na bilis sa loob ng isang sandboxed tab nang walang plugin at walang install.
On-device inference
Ang ~75 MB quantized model ay na-load at ang decoding loop ay ganap na pinapatakbo sa client-side. Walang bahagi ng pipeline ang tumatawag sa isang server kapag na-load na ang pahina.
Web Audio API
Ang iyong file ay dini-decode at ni-resample sa 16 kHz mono na inaasahan ng modelo gamit ang sariling audio pipeline ng browser, kaya anumang format na kayang i-play ng iyong browser ay tinatanggap.
Premium - mula rin sa Subformer

Mga Madalas na Katanungan

Subukan ang iba pang libreng speech-to-text na wika