Subformer
Gratis · Tanpa pendaftaran · Berjalan di browser Anda

Ucapan ke Teks Gratis dalam 35+ Bahasa

Jatuhkan file audio atau video apa saja, pilih bahasa, dan dapatkan transkrip lengkap dengan stempel waktu - semuanya di browser Anda. Model diunduh sekali (~75 MB) dan disimpan di cache secara lokal, sehingga penggunaan berikutnya instan dan dapat berjalan secara offline.

Pribadi secara default

Pengenalan berjalan secara lokal. Audio Anda tidak pernah meninggalkan perangkat.

Instan setelah pemuatan pertama

Model disimpan di cache peramban Anda. Penggunaan berikutnya berfungsi secara offline.

Gratis, tanpa daftar

Tanpa akun, tanpa kredit, tanpa batasan penggunaan. Buka dan gunakan.

Pilih bahasa

Di balik layar

Pengenalan ucapan biasanya berarti mengunggah audio Anda ke GPU seseorang. Di sini model berjalan di mesin Anda sendiri, itulah yang membuat alat ini gratis dan pribadi pada saat yang bersamaan.

Open-source recognition model
Build terkuantisasi dari model pengenalan ucapan neural sumber terbuka, cukup kecil untuk diunduh sekali dan disimpan di browser Anda.
WebAssembly
Runtime inferensi dikompilasi ke WebAssembly, sehingga kode numerik berjalan pada kecepatan mendekati asli di dalam tab sandbox tanpa plugin dan tanpa instalasi.
On-device inference
Memuat model, melakukan tokenisasi, dan menjalankan loop decoding semuanya terjadi di sisi klien. Tidak ada bagian dari pipeline yang memanggil server setelah halaman dimuat.
Web Audio API
File Anda didekode dan di-resample ke mono 16 kHz yang diharapkan model menggunakan pipeline audio browser sendiri, sehingga format apa pun yang dapat diputar browser Anda diterima.

Komprominya adalah ukuran model. Bobot di perangkat adalah sebagian kecil dari apa yang dijalankan layanan yang di-hosting, sehingga akurasi menurun pada audio bising, aksen kuat, dan pembicara yang tumpang tindih - di situlah opsi cloud di bawah ini menunjukkan nilainya.

Butuh akurasi lebih tinggi atau lebih banyak bahasa?

Speech to Text Berbasis Cloud

Alat gratis dalam browser menjalankan model sumber terbuka kecil - baik untuk audio bersih, tetapi dapat kesulitan dengan aksen yang kuat, kebisingan, atau pembicara yang tumpang tindih, dan hanya mencakup sejumlah bahasa terbatas. Untuk akurasi tingkat siaran, dukungan bahasa yang jauh lebih luas, dan unduhan SRT/VTT/TXT, gunakan Speech to Text berbasis cloud berbayar kami.

Coba Speech to Text berbasis cloud