Subformer
സൗജന്യമാണ് · സൈൻഅപ് ആവശ്യമ छैन · നിങ്ങളുടെ ബ്രൗസറിൽ പ്രവർത്തിക്കുന്നു

സൗജന്യ Mandarin ശബ്ദം-ടു-ടെക്സ്റ്റ്

中文

ഒരു Mandarin ഓഡിയോ അല്ലെങ്കിൽ വീഡിയോ ഫയൽ ഇവിടെവീഴ്ത്തി ടൈംസ്റ്റാമ്പുകളോടെയുള്ള പൂര്‍ണ്ണ ട്രാൻസ്ക്രിപ്റ്റ് നേടുക - എല്ലാം നിങ്ങളുടെ ബ്രൗസറിൽ, സൈൻഅപ്പില്ല. മോഡൽ ഒരിക്കൽ (~75 MB) ഡൗൺലോഡ് ചെയ്ത് പ്രാദേശികമായി കാഷ് ചെയ്യപെടുന്നു, അതിനാൽ പിന്നീട് റൺകൾ ഉടനെ നടക്കുകയും ഓഫ്‌లൈനിലും പ്രവർത്തിക്കുകയും ചെയ്യുന്നു.

ബ്രൗസർ പിന്തുണ പരിശോധിക്കുന്നു…

ഉയർന്ന കൃത്യതയോ കൂടുതൽ ഭാഷകളോ ആവശ്യമുണ്ടോ?

ക്ലൗഡ് അധിഷ്ഠിത Mandarin സ്പീച്ച് ടു ടെക്സ്റ്റ്

സൗജന്യ ഇൻ-ബ്രൗസർ ടൂൾ ഒരു ചെറിയ ഓപ്പൺ സോഴ്സ് മോഡൽ പ്രവർത്തിപ്പിക്കുന്നു - ഇത് വ്യക്തമായ ഓഡിയോയ്ക്ക് നല്ലതാണ്, പക്ഷേ കനത്ത Mandarin ആക്സന്റുകൾ, ശബ്ദം, അല്ലെങ്കിൽ ഓവർലാപ്പ് ചെയ്യുന്ന സ്പീക്കറുകൾ എന്നിവയിൽ ഇത് ബുദ്ധിമുട്ടായേക്കാം, കൂടാതെ പരിമിതമായ ഭാഷകളെ മാത്രമേ ഇത് പിന്തുണയ്ക്കുന്നുള്ളൂ. ബ്രോഡ്കാസ്റ്റ്-ഗ്രേഡ് കൃത്യതയ്ക്കും, കൂടുതൽ വിപുലമായ ഭാഷാ പിന്തുണയ്ക്കും, SRT/VTT/TXT ഡൗൺലോഡുകൾക്കും, ഞങ്ങളുടെ പണമടച്ചുള്ള ക്ലൗഡ് അധിഷ്ഠിത സ്പീച്ച് ടു ടെക്സ്റ്റ് ഉപയോഗിക്കുക.

ക്ലൗഡ് അധിഷ്ഠിത സ്പീച്ച് ടു ടെക്സ്റ്റ് പരീക്ഷിക്കുക

ഇത് എങ്ങനെ പ്രവർത്തിക്കുന്നു

  1. 1. ഒരു ഫയൽ ഇവിടെവീഴ്ത്തുക

    ഏതെങ്കിലും Mandarin ഓഡിയോ അല്ലെങ്കിൽ വീഡിയോ ഇവിടെവീഴ്ത്തുക - MP3, WAV, M4A, MP4, WEBM എന്നിവയെല്ലാം പിന്തുണയ്ക്കപ്പെടുന്നു.

  2. 2. ലിപിയിലാക്കുക

    ആദ്യ ക്ലിക്ക് ~75 MB മോഡൽ നിങ്ങളുടെ ബ്രൗസറിലേക്ക് ഡൗൺലോഡ് ചെയ്യുന്നതാണ്. അതിന് ശേഷം തിരിച്ചറിയൽ ഉടനാണ്, കൂടാതെ ഓഫ്‌ലൈനായും പ്രവർത്തിക്കാം.

  3. 3. ഡൗൺലോഡ് ചെയ്യുക

    ട്രാൻസ്ക്രിപ്റ്റ് TXT, SRT, അല്ലെങ്കിൽ VTT ആയി സേവ് ചെയ്യുക. നിങ്ങളുടെ ഓഡിയോയും ഫലവും നിങ്ങളുടെ ഉപകരണത്തിന് പുറത്തേക്കുനേടുകയില്ല.

നിങ്ങളുടെ ഓഡിയോ നിങ്ങളുടെ ഉപകരണത്തിലേ തന്നെ ഉപേക്ഷിക്കുന്നു

റികഗ്നിഷൻ WebAssembly ഉപയോഗിച്ച് പൂർണ്ണമായി നിങ്ങളുടെ ബ്രൗസറിലേയാണ് പ്രവർത്തിക്കുന്നത്. നെറ്റ്‌വർക്ക് അഭ്യർത്ഥനകൾ മോഡൽയും WebAssembly റൺടൈമും മാത്രം എടുക്കുന്നതിനാണ് - ഇരുവരും പൊതു സ്റ്റാറ്റിക് ആസറ്റുകളാണ്. നിങ്ങളുടെ ഓഡിയോയും ട്രാൻസ്ക്രിപ്റ്റും നാം കാണുന്നില്ല.

നിങ്ങളുടെ ബ്രൗസറിൽ Mandarin ട്രാൻസ്ക്രിപ്ഷൻ എങ്ങനെ പ്രവർത്തിക്കുന്നു

സ്പീച്ച് റെക്കഗ്നിഷൻ സാധാരണയായി നിങ്ങളുടെ ഓഡിയോ മറ്റൊരാളുടെ GPU-ലേക്ക് അപ്‌ലോഡ് ചെയ്യുക എന്നാണ് അർത്ഥമാക്കുന്നത്. ഇവിടെ മോഡൽ നിങ്ങളുടെ സ്വന്തം മെഷീനിൽ പ്രവർത്തിക്കുന്നു, ഇത് ഇതിനെ സൗജന്യവും അതേ സമയം സ്വകാര്യവുമാക്കുന്നു.

Open-source recognition model
ബഹുഭാഷാ ഓഡിയോയിൽ പരിശീലനം ലഭിച്ച ഒരു ഓപ്പൺ സോഴ്‌സ് ന്യൂറൽ മോഡൽ - അതുകൊണ്ടാണ് ഒരു ഡൗൺലോഡ് Mandarin കൈകാര്യം ചെയ്യുന്നത്, ഭാഷാ-നിർദ്ദിഷ്ട മോഡലുകളൊന്നും എടുക്കേണ്ടതില്ല.
WebAssembly
ഇൻഫറൻസ് റൺടൈം വെബ്അസംബ്ലിയിലേക്ക് കംപൈൽ ചെയ്തിരിക്കുന്നു, അതിനാൽ സംഖ്യാപരമായ കോഡ് പ്ലഗിനോ ഇൻസ്റ്റാളോ ഇല്ലാതെ ഒരു സാൻഡ്‌ബോക്സ്ഡ് ടാബിനുള്ളിൽ നേറ്റീവ് വേഗതയിൽ പ്രവർത്തിക്കുന്നു.
On-device inference
ഏകദേശം 75 MB ക്വാണ്ടൈസ്ഡ് മോഡൽ ലോഡ് ചെയ്യുകയും ഡീകോഡിംഗ് ലൂപ്പ് പൂർണ്ണമായും ക്ലയന്റ്-സൈഡിൽ പ്രവർത്തിപ്പിക്കുകയും ചെയ്യുന്നു. പേജ് ലോഡ് ചെയ്തുകഴിഞ്ഞാൽ പൈപ്പ്ലൈനിന്റെ ഒരു ഭാഗവും ഒരു സെർവറിലേക്ക് വിളിക്കുന്നില്ല.
Web Audio API
നിങ്ങളുടെ ഫയൽ ഡീകോഡ് ചെയ്യുകയും ബ്രൗസറിന്റെ സ്വന്തം ഓഡിയോ പൈപ്പ്‌ലൈൻ ഉപയോഗിച്ച് മോഡൽ പ്രതീക്ഷിക്കുന്ന 16 kHz മോണോയിലേക്ക് റീസാംപിൾ ചെയ്യുകയും ചെയ്യുന്നു, അതിനാൽ നിങ്ങളുടെ ബ്രൗസറിന് പ്ലേ ചെയ്യാൻ കഴിയുന്ന ഏതൊരു ഫോർമാറ്റും സ്വീകാര്യമാണ്.
പ്രീമിയം - Subformer നിൽ നിന്നും

അक्सर ചോദിക്കപ്പെടുന്ന ചോദ്യങ്ങൾ

മറ്റുള്ള സൗജന്യ സ്പീച്ച്-ടു-ടെക്സ്റ്റ് ഭാഷകൾ പരീക്ഷിക്കുക