Subformer
Bezpłatne · Bez rejestracji · Działa w przeglądarce

Darmowe rozpoznawanie mowy w 35+ językach

Upuść dowolny plik audio lub wideo, wybierz język i otrzymaj pełną transkrypcję ze znacznikami czasu - wszystko w przeglądarce. Model jest pobierany raz (~75 MB) i zapisywany lokalnie w pamięci podręcznej, więc kolejne uruchomienia są natychmiastowe i działają offline.

Domyślnie prywatne

Rozpoznawanie działa lokalnie. Twoje audio nigdy nie opuszcza urządzenia.

Natychmiast po pierwszym załadowaniu

Model jest przechowywany w pamięci podręcznej przeglądarki. Kolejne uruchomienia działają offline.

Darmowe, bez rejestracji

Brak konta, brak kredytów, brak limitu użycia. Otwórz i używaj.

Wybierz język

Pod maską

Rozpoznawanie mowy zazwyczaj oznacza przesyłanie audio na czyjeś GPU. Tutaj model działa na Twojej własnej maszynie, co sprawia, że narzędzie jest jednocześnie darmowe i prywatne.

Open-source recognition model
Skwantowana wersja otwartego neuronowego modelu rozpoznawania mowy, wystarczająco mała, by pobrać raz i przechowywać w przeglądarce.
WebAssembly
Środowisko wykonawcze wnioskowania jest skompilowane do WebAssembly, więc kod numeryczny działa z prędkością zbliżoną do natywnej w piaskownicy przeglądarki, bez wtyczek i instalacji.
On-device inference
Ładowanie modelu, tokenizacja i uruchamianie pętli dekodowania odbywają się po stronie klienta. Żadna część potoku nie wywołuje serwera po załadowaniu strony.
Web Audio API
Twój plik jest dekodowany i ponownie próbkowany do mono 16 kHz, którego oczekuje model, za pomocą własnego potoku audio przeglądarki, więc akceptowany jest każdy format, który Twoja przeglądarka może odtworzyć.

Kompromisem jest rozmiar modelu. Wagi na urządzeniu stanowią ułamek tego, co działa w usłudze hostowanej, więc dokładność spada w przypadku szumnego dźwięku, silnych akcentów i nakładających się mówców – to właśnie tutaj opcja chmurowa poniżej zyskuje na wartości.

Potrzebujesz większej dokładności lub więcej języków?

Zamiana mowy na tekst w chmurze

Darmowe narzędzie w przeglądarce wykorzystuje mały model open-source – jest dobre dla czystego dźwięku, ale może mieć problemy z silnymi akcentami, szumem lub nakładającymi się głosami, i obsługuje tylko ograniczony zestaw języków. Aby uzyskać dokładność na poziomie nadawczym, znacznie szersze wsparcie językowe oraz pobieranie plików SRT/VTT/TXT, skorzystaj z naszej płatnej usługi zamiany mowy na tekst w chmurze.

Wypróbuj zamianę mowy na tekst w chmurze