Subformer
ఉచితం · సైన్‌అప్ అవసరం లేదు · మీ బ్రౌజర్లో నడుస్తుంది

ఉచితం Urdu స్పీచ్-టు-టెక్స్ట్

اردو

ఒక Urdu ఆడియో లేదా వీడియో ఫైల్‌ను డ్రాప్ చేసి టైమ్‌స్టాంప్‌లుతో పూర్తి ట్రాన్స్క్రిప్ట్ పొందండి - అన్ని మీ బ్రౌజర్‌లోనే, సైన్ అప్ అవసరం లేదు. మోడల్ ఒకసారి (~75 MB) డౌన్లోడ్ చేసి స్థానికంగా క్యాష్ చేయబడుతుంది, కాబట్టి తర్వాతి నడపులు తక్షణంగా ఉంటాయి మరియు ఆఫ్‌లైన్‌లో పనిచేస్తాయి.

బ్రౌజర్ మద్దతును తనిఖీ చేస్తోంది…

అధిక ఖచ్చితత్వం లేదా మరిన్ని భాషలు కావాలా?

క్లౌడ్-ఆధారిత Urdu స్పీచ్ టు టెక్స్ట్

ఉచిత ఇన్-బ్రౌజర్ సాధనం చిన్న ఓపెన్-సోర్స్ మోడల్‌ను నడుపుతుంది - ఇది స్పష్టమైన ఆడియోకు బాగానే ఉంటుంది, కానీ ఇది భారీ Urdu యాక్సెంట్‌లు, శబ్దం లేదా అతివ్యాప్తి చెందుతున్న స్పీకర్‌లతో ఇబ్బంది పడవచ్చు మరియు పరిమిత భాషలను మాత్రమే కవర్ చేస్తుంది. బ్రాడ్‌కాస్ట్-గ్రేడ్ ఖచ్చితత్వం, విస్తృత భాషా మద్దతు మరియు SRT/VTT/TXT డౌన్‌లోడ్‌ల కోసం, మా చెల్లింపు క్లౌడ్-ఆధారిత స్పీచ్ టు టెక్స్ట్‌ను ఉపయోగించండి.

క్లౌడ్-ఆధారిత స్పీచ్ టు టెక్స్ట్‌ను ప్రయత్నించండి

ఇది ఎలా పని చేస్తుంది

  1. 1. ఒక ఫైల్‌ను వదిలివేయండి

    ఏ Urdu ఆడియో లేదా వీడియోను డ్రాప్ చేయండి - MP3, WAV, M4A, MP4, మరియు WEBM అన్నీ మద్దతు పొందుతాయి.

  2. 2. లిప్యంతరం చేయండి

    మొదటి క్లిక్ సుమారు ~75 MB మోడల్‌ను మీ బ్రౌజర్‌కు డౌన్లోడ్ చేస్తుంది. ఆ తర్వాత గుర్తింపు తక్షణంగా మరియు ఆఫ్‌లైన్‌లో పనిచేస్తుంది.

  3. 3. డౌన్లోడ్

    ట్రాన్స్క్రిప్ట్‌ను TXT, SRT లేదా VTT గా సేవ్ చేయండి. మీ ఆడియో మరియు ఫలితం ఎప్పుడూ మీ పరికరాన్ని విడవవు

మీ ఆడియో మీ పరికరంలోనే ఉంటుంది

గుర్తింపు పూర్తిగా మీ బ్రౌజర్‌లో WebAssembly ఉపయోగించి నడుస్తుంది. ఒకే network అభ్యర్థనలు మోడల్ మరియు WebAssembly రన్‌టైమ్‌ను పొందడానికి మాత్రమే ఉంటాయి - అవి రెండూ ప్రజా, స్థిర ఆస్తులు. మేము మీ ఆడియోను చూడము మరియు ట్రాన్స్క్రిప్ట్‌ను కూడా చూడము

మీ బ్రౌజర్‌లో Urdu ట్రాన్స్‌క్రిప్షన్ ఎలా నడుస్తుంది

స్పీచ్ రికగ్నిషన్ సాధారణంగా మీ ఆడియోను ఎవరిదైనా GPUకి అప్‌లోడ్ చేయడాన్ని సూచిస్తుంది. ఇక్కడ మోడల్ మీ స్వంత మెషీన్‌లో నడుస్తుంది, ఇది దీన్ని ఒకే సమయంలో ఉచితంగా మరియు ప్రైవేట్‌గా చేస్తుంది.

Open-source recognition model
బహుభాషా ఆడియోపై శిక్షణ పొందిన ఓపెన్-సోర్స్ న్యూరల్ మోడల్ - అందుకే ఒక డౌన్‌లోడ్ Urduని భాషా-నిర్దిష్ట మోడల్ లేకుండానే నిర్వహిస్తుంది.
WebAssembly
ఇన్ఫరెన్స్ రన్‌టైమ్ వెబ్‌అసెంబ్లీకి కంపైల్ చేయబడింది, కాబట్టి సంఖ్యా కోడ్ ప్లగిన్ లేకుండా మరియు ఇన్‌స్టాల్ లేకుండా సాండ్‌బాక్స్డ్ ట్యాబ్‌లో స్థానిక వేగానికి దగ్గరగా నడుస్తుంది.
On-device inference
~75 MB క్వాంటైజ్డ్ మోడల్ లోడ్ చేయబడుతుంది మరియు డీకోడింగ్ లూప్ పూర్తిగా క్లయింట్-సైడ్‌లో నడుస్తుంది. పేజీ లోడ్ అయిన తర్వాత పైప్‌లైన్‌లో ఏదీ సర్వర్‌కు కాల్ చేయదు.
Web Audio API
మీ ఫైల్ డీకోడ్ చేయబడుతుంది మరియు బ్రౌజర్ యొక్క స్వంత ఆడియో పైప్‌లైన్‌ను ఉపయోగించి మోడల్ ఆశించే 16 kHz మోనోకు తిరిగి నమూనా చేయబడుతుంది, కాబట్టి మీ బ్రౌజర్ ప్లే చేయగల ఏదైనా ఫార్మాట్ ఆమోదించబడుతుంది.
ప్రీమియం - Subformer నుంచి కూడా

తరచుగా అడిగే ప్రశ్నలు

ఇతర ఉచిత స్పీచ్-టు-టెక్స్ట్ భాషలను ప్రయత్నించండి