Subformer
Kostenlos · Keine Anmeldung · Läuft in Ihrem Browser

Kostenloses Speech-to-Text in 35+ Sprachen

Ziehen Sie eine beliebige Audio- oder Videodatei hinein, wählen Sie eine Sprache und erhalten Sie ein vollständiges Transkript mit Zeitstempeln - alles in Ihrem Browser. Das Modell wird einmal heruntergeladen (~75 MB) und lokal zwischengespeichert, sodass nachfolgende Durchläufe sofort verfügbar sind und offline funktionieren.

Standardmäßig privat

Die Erkennung läuft lokal. Ihr Audio verlässt Ihr Gerät niemals.

Nach dem ersten Laden sofort

Das Modell wird in Ihrem Browser zwischengespeichert. Weitere Durchläufe funktionieren offline.

Kostenlos, keine Anmeldung

Kein Konto, keine Credits, keine Nutzungsbegrenzung. Einfach öffnen und verwenden.

Sprache wählen

Unter der Haube

Spracherkennung bedeutet normalerweise, Ihr Audio auf die GPU eines anderen hochzuladen. Hier läuft das Modell stattdessen auf Ihrem eigenen Gerät, was das Tool gleichzeitig kostenlos und privat macht.

Open-source recognition model
Eine quantisierte Version eines quelloffenen neuronalen Spracherkennungsmodells, klein genug, um einmal heruntergeladen und in Ihrem Browser gespeichert zu werden.
WebAssembly
Die Inferenz-Laufzeitumgebung wird zu WebAssembly kompiliert, sodass der numerische Code mit nahezu nativer Geschwindigkeit in einem Sandbox-Tab ohne Plugin und ohne Installation ausgeführt wird.
On-device inference
Das Laden des Modells, die Tokenisierung und das Ausführen der Dekodierungsschleife erfolgen alle clientseitig. Kein Teil der Pipeline ruft nach dem Laden der Seite einen Server auf.
Web Audio API
Ihre Datei wird dekodiert und auf das vom Modell erwartete 16 kHz Mono umgewandelt, wobei die Audio-Pipeline des Browsers verwendet wird, sodass jedes Format akzeptiert wird, das Ihr Browser abspielen kann.

Der Kompromiss ist die Modellgröße. Die On-Device-Gewichte sind ein Bruchteil dessen, was ein gehosteter Dienst ausführt, sodass die Genauigkeit bei verrauschtem Audio, starken Akzenten und überlappenden Sprechern abnimmt – hier spielt die untenstehende Cloud-Option ihre Stärken aus.

Benötigen Sie höhere Genauigkeit oder mehr Sprachen?

Cloud-basiertes Speech to Text

Das kostenlose In-Browser-Tool verwendet ein kleines Open-Source-Modell – gut für sauberes Audio, aber es kann bei starken Akzenten, Rauschen oder überlappenden Sprechern Schwierigkeiten haben und deckt nur eine begrenzte Anzahl von Sprachen ab. Für Genauigkeit auf Sendequalität, wesentlich breitere Sprachunterstützung und SRT/VTT/TXT-Downloads nutzen Sie unser kostenpflichtiges Cloud-basiertes Speech to Text.

Cloud-basiertes Speech to Text ausprobieren