Subformer
বিনামূল্যে · সাইনআপ নেই · আপনার ব্রাউজারে চলে

বিনামূল্যে Kazakh টেক্সট-টু-স্পিচ

Қазақ тілі

টাইপ বা Kazakh টেক্সট পেস্ট করুন এবং তা শুনুন - সবই আপনার ব্রাউজারে, কোনো সাইনআপ ছাড়াই। ভয়েস মডেল একবার ডাউনলোড হয় (~122 MB) এবং লোকালি ক্যাশ করা হয়, তাই পরের রানে তা তৎক্ষণাত কাজ করে এবং অফলাইনে চলে।

কীভাবে এটি কাজ করে

  1. 1. আপনার টেক্সট টাইপ করুন

    যেকোনো Kazakh টেক্সট পেস্ট করুন বা টাইপ করুন - বিরামচিহ্ন এবং লাইনের বিরতি মেনে নেওয়া হয়.

  2. 2. তৈরি করুন

    প্রথম ক্লিকে প্রায় 122 MB ভয়েস মডেল আপনার ব্রাউজারে ডাউনলোড হয়। এরপর থেকে সিন্থেসিস তাৎক্ষণিক।

  3. 3. ডাউনলোড বা প্লে করুন

    অডিও ইনলাইন প্লে করুন বা এটিকে WAV ফাইল হিসেবে সংরক্ষণ করুন। অডিও কখনও আপনার ডিভাইস ছাড়ে না।

আপনার টেক্সট আপনার ডিভাইসে থাকে

সিন্থেসিস সম্পূর্ণরূপে আপনার ব্রাউজারে ওয়েবঅ্যাসেম্বলি ব্যবহার করে চলে। একমাত্র নেটওয়ার্ক অনুরোধগুলি হল ভয়েস মডেল এবং ইনফারেন্স রানটাইম আনতে - উভয়ই পাবলিক, স্ট্যাটিক অ্যাসেট। আমরা আপনার টেক্সট দেখি না এবং আমরা তৈরি করা অডিও দেখি না।

আপনার ব্রাউজারে Kazakh ভয়েস কীভাবে চলে

এটি আপনার নিজের মেশিনে এক্সিকিউট হওয়া একটি বাস্তব নিউরাল TTS মডেল, কোনো হোস্ট করা API-এর জন্য পাতলা ক্লায়েন্ট নয়। চারটি অংশ একটি ট্যাবে এটি সম্ভব করে তোলে।

Open-source neural voice
Kazakh মডেলটি একজন একক স্পিকারের উপর প্রশিক্ষিত, এই কারণেই আপনি যা কিছু সিন্থেসাইজ করেন তার জুড়ে উচ্চারণ এবং ডেলিভারি সামঞ্জস্যপূর্ণ থাকে।
WebAssembly
মডেল রানটাইম এবং যে ধাপটি Қазақ тілі টেক্সটকে ফোনেমে পরিণত করে, উভয়ই ওয়েবঅ্যাসেম্বলিতে কম্পাইল করা হয়েছে, তাই ডেস্কটপের জন্য মূলত লেখা কোড ব্রাউজার স্যান্ডবক্সের ভিতরে প্রায় নেটিভ গতিতে চলে।
On-device inference
মডেলের নিউরাল নেটওয়ার্ক স্থানীয়ভাবে এক্সিকিউট করা হয়, সিঙ্গেল-থ্রেডেড মোডে পিন করা থাকে যাতে পেজটির ক্রস-অরিজিন আইসোলেশনের প্রয়োজন না হয় এবং এটি প্রতিটি আধুনিক ব্রাউজারে কাজ করে।
Origin Private File System
প্রথমবার চালানোর পর প্রায় 122 MB ভয়েস মডেল একটি ব্যক্তিগত, প্রতি-অরিজিন স্টোরে ক্যাশ করা হয়। পরবর্তী ভিজিটগুলি ডাউনলোড এড়িয়ে যায় এবং কোনো নেটওয়ার্ক ছাড়াই সংশ্লেষণ করে।
ব্রডকাস্ট-গুণগত মানের ভয়েস দরকার?

Subformer Voice Synthesis - স্টুডিও-গ্রেড Kazakh TTS

উপরে থাকা বিনামূল্যের ব্রাউজার-ভিত্তিক টুল খসড়া ও পূর্বরূপের জন্য দুর্দান্ত, কিন্তু ওপেন-সোর্স কণ্ঠটি স্পষ্টভাবে কৃত্রিম শোনায়। Subformer-এর সশুল্ক ভয়েস সংশ্লেষণ ঐচ্ছিক ভয়েস ক্লোনিংসহ প্রাকৃতিক, সম্প্রচার-মানের অডিও তৈরি করে।

Subformer Voice Synthesis ব্যবহার করে দেখুন
প্রিমিয়াম - Subformer থেকেও

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

অন্যান্য ফ্রি TTS ভাষা চেষ্টা করুন

ভয়েসগুলো চালিত হচ্ছে Piper দ্বারা। ভয়েস ওজনগুলো MIT-লাইসেন্সভুক্ত (rhasspy/piper-voices)। ফনেমাইজার wasm রানটাইমে একটি পাবলিক CDN থেকে লোড করা হয় এবং এই সাইটের ডিস্ট্রিবিউশনের অংশ নয়।