Subformer
বিনামূল্যে · সাইনআপ নেই · আপনার ব্রাউজারে চলে

বিনামূল্যে Vietnamese স্পিচ-টু-টেক্সট

Tiếng Việt

একটি Vietnamese অডিও বা ভিডিও ফাইল ছেড়ে টাইমস্ট্যাম্পসহ সম্পূর্ণ ট্রান্সক্রিপ্ট পান - সবই আপনার ব্রাউজারে, কোনো সাইনআপ ছাড়াই। মডেলটি একবার (~75 MB) ডাউনলোড করা হয় এবং লোকালি ক্যাশে রাখা হয়, তাই পরবর্তী চালানো তৎক্ষণাৎ এবং অফলাইনে কাজ করে।

ব্রাউজারের সমর্থন যাচাই করা হচ্ছে…

উচ্চতর নির্ভুলতা বা আরও ভাষা প্রয়োজন?

ক্লাউড-ভিত্তিক Vietnamese স্পিচ টু টেক্সট

বিনামূল্যে ইন-ব্রাউজার টুলটি একটি ছোট ওপেন-সোর্স মডেল চালায় - পরিষ্কার অডিওর জন্য এটি ভালো, তবে এটি ভারী Vietnamese উচ্চারণ, শব্দ বা ওভারল্যাপিং স্পিকারদের সাথে সংগ্রাম করতে পারে এবং শুধুমাত্র সীমিত সংখ্যক ভাষা কভার করে। ব্রডকাস্ট-গ্রেড নির্ভুলতা, আরও বিস্তৃত ভাষা সমর্থন এবং SRT/VTT/TXT ডাউনলোডের জন্য, আমাদের পেইড ক্লাউড-ভিত্তিক স্পিচ টু টেক্সট ব্যবহার করুন।

ক্লাউড-ভিত্তিক স্পিচ টু টেক্সট চেষ্টা করুন

কীভাবে এটি কাজ করে

  1. 1. একটি ফাইল এখানে ছেড়ে দিন

    যেকোনো Vietnamese অডিও বা ভিডিও এখানে ছেড়ে দিন - MP3, WAV, M4A, MP4, এবং WEBM সবই সমর্থিত।

  2. 2. ট্রান্সক্রাইব করুন

    প্রথম ক্লিকে ~75 MB মডেলটি আপনার ব্রাউজারে ডাউনলোড হবে। এর পরে, স্বীকৃতি তাৎক্ষণিক এবং অফলাইনে কাজ করতে সক্ষম।

  3. 3. ডাউনলোড করুন

    ট্রান্সক্রিপ্টটি TXT, SRT, বা VTT হিসেবে সংরক্ষণ করুন. আপনার অডিও এবং ফলাফল কখনই আপনার ডিভাইস ছাড়ে না.

আপনার অডিও আপনার ডিভাইসে থাকে

সনাক্তকরণ সম্পূর্ণভাবে আপনার ব্রাউজারে WebAssembly ব্যবহার করে চলে. একমাত্র নেটওয়ার্ক অনুরোধগুলি মডেল ও WebAssembly রানটাইম আনত—উভয়ই পাবলিক, স্ট্যাটিক অ্যাসেট. আমরা আপনার অডিও দেখি না এবং আমরা ট্রান্সক্রিপ্টও দেখি না.

আপনার ব্রাউজারে Vietnamese ট্রান্সক্রিপশন কীভাবে চলে

স্পিচ রিকগনিশন সাধারণত আপনার অডিও অন্যের GPU তে আপলোড করা বোঝায়। এখানে মডেলটি আপনার নিজের মেশিনে চলে, যা এটিকে একই সাথে বিনামূল্যে এবং ব্যক্তিগত করে তোলে।

Open-source recognition model
একটি ওপেন-সোর্স নিউরাল মডেল যা বহুভাষিক অডিওতে প্রশিক্ষিত - এই কারণেই একটি ডাউনলোড Vietnamese পরিচালনা করে এবং কোনো ভাষা-নির্দিষ্ট মডেল আনতে হয় না।
WebAssembly
ইনফারেন্স রানটাইম ওয়েবঅ্যাসেম্বলিতে কম্পাইল করা হয়েছে, তাই সংখ্যাসূচক কোড একটি স্যান্ডবক্সড ট্যাবের ভিতরে প্রায় নেটিভ গতিতে চলে, কোনো প্লাগইন বা ইনস্টল ছাড়াই।
On-device inference
~75 MB কোয়ান্টাইজড মডেল লোড করা হয় এবং ডিকোডিং লুপ সম্পূর্ণরূপে ক্লায়েন্ট-সাইডে চালিত হয়। পৃষ্ঠা লোড হওয়ার পরে পাইপলাইনের কোনো অংশই সার্ভারে কল করে না।
Web Audio API
আপনার ফাইলটি ডিকোড করা হয় এবং ব্রাউজারের নিজস্ব অডিও পাইপলাইন ব্যবহার করে মডেলের প্রত্যাশিত 16 kHz মনোতে রিস্যাম্পল করা হয়, তাই আপনার ব্রাউজার যে কোনো ফরম্যাট চালাতে পারে তা গৃহীত হয়।
প্রিমিয়াম - Subformer থেকেও

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

অন্যান্য বিনামূল্যের স্পিচ-টু-টেক্সট ভাষাগুলো চেষ্টা করুন