Subformer
मोफत · नोंदणी नाही · तुमच्या ब्राउझरमध्ये चालते

विनामूल्य German स्पीच-टू-टेक्स्ट

Deutsch

German ऑडिओ किंवा व्हिडिओ फाइल टाका आणि टाइमस्टँपसह संपूर्ण ट्रान्सक्रिप्ट मिळवा - हे सर्व तुमच्या ब्राउझरमध्ये, कोणत्याही साइनअपशिवाय. मॉडेल एकदाच (~75 MB) डाउनलोड होते आणि स्थानिकरित्या कॅश केले जाते, त्यामुळे नंतरचे चालवणे तत्काळ होते आणि ऑफलाइन कार्य करते.

ब्राउझर समर्थन तपासत आहे…

उच्च अचूकता किंवा अधिक भाषांची आवश्यकता आहे का?

क्लाउड-आधारित German स्पीच टू टेक्स्ट

विनामूल्य इन-ब्राउझर साधन एक लहान ओपन-सोर्स मॉडेल चालवते - स्वच्छ ऑडिओसाठी ठीक आहे, परंतु ते जड German उच्चार, आवाज किंवा ओव्हरलॅपिंग स्पीकर्ससह संघर्ष करू शकते आणि केवळ मर्यादित भाषांना समर्थन देते. ब्रॉडकास्ट-ग्रेड अचूकता, व्यापक भाषा समर्थन आणि SRT/VTT/TXT डाउनलोडसाठी, आमचे सशुल्क क्लाउड-आधारित स्पीच टू टेक्स्ट वापरा.

क्लाउड-आधारित स्पीच टू टेक्स्ट वापरून पहा

हे कसे काम करते

  1. 1. फाइल ड्रॉप करा

    कोणतीही German ऑडिओ किंवा व्हिडिओ फाइल टाका - MP3, WAV, M4A, MP4 आणि WEBM सर्व समर्थित आहेत.

  2. 2. प्रतिलेखन करा

    पहिल्या क्लिकने सुमारे 75 MB चे मॉडेल तुमच्या ब्राउझरमध्ये डाउनलोड होते. त्यानंतर, ओळख तत्काळ होते आणि ऑफलाइन सक्षम असते.

  3. 3. डाउनलोड करा

    ट्रान्सक्रिप्ट TXT, SRT किंवा VTT स्वरूपात जतन करा. तुमचे ऑडिओ आणि निकाल कधीही तुमच्या डिव्हाइसच्या बाहेर जात नाहीत.

तुमचा ऑडिओ तुमच्या डिव्हाइसवर राहतो

ओळख पूर्णपणे तुमच्या ब्राउझरमध्ये WebAssembly वापरून चालते. एकमेव नेटवर्क विनंत्या मॉडेल आणि WebAssembly runtime आणण्यासाठी असतात - दोन्ही सार्वजनिक, स्थिर संसाधने आहेत. आम्हाला तुमचे ऑडिओ दिसत नाही आणि आम्हाला ट्रान्सक्रिप्ट देखील दिसत नाही.

तुमच्या ब्राउझरमध्ये German ट्रान्सक्रिप्शन कसे चालते

स्पीच रेकग्निशनचा सामान्यतः अर्थ तुमचा ऑडिओ कोणाच्यातरी GPU वर अपलोड करणे असा होतो. येथे मॉडेल तुमच्या स्वतःच्या मशीनवर चालते, ज्यामुळे हे एकाच वेळी विनामूल्य आणि खाजगी बनते.

Open-source recognition model
बहुभाषिक ऑडिओवर प्रशिक्षित केलेले एक ओपन-सोर्स न्यूरल मॉडेल - म्हणूनच एका डाउनलोडमध्ये German हाताळले जाते आणि भाषेनुसार विशिष्ट मॉडेल डाउनलोड करण्याची गरज नसते.
WebAssembly
इन्फरन्स रनटाइम वेबअसेम्बलीमध्ये संकलित केले जाते, त्यामुळे संख्यात्मक कोड सँडबॉक्स केलेल्या टॅबमध्ये प्लगइन किंवा इन्स्टॉलशिवाय जवळजवळ मूळ वेगाने चालतो.
On-device inference
~75 MB क्वांटाइज्ड मॉडेल लोड केले जाते आणि डीकोडिंग लूप पूर्णपणे क्लायंट-साइडवर चालवले जाते. पृष्ठ लोड झाल्यानंतर पाइपलाइनमधील काहीही सर्व्हरला कॉल करत नाही.
Web Audio API
तुमची फाइल डीकोड केली जाते आणि ब्राउझरच्या स्वतःच्या ऑडिओ पाइपलाइनचा वापर करून मॉडेलला अपेक्षित असलेल्या 16 kHz मोनोमध्ये पुन्हा सॅम्पल केली जाते, त्यामुळे तुमचा ब्राउझर प्ले करू शकणारे कोणतेही स्वरूप स्वीकारले जाते.
प्रीमियम - Subformer कडूनही

वारंवार विचारले जाणारे प्रश्न

इतर विनामूल्य स्पीच-टू-टेक्स्ट भाषा वापरून पहा