Subformer
無料 · サインアップ不要 · ブラウザ上で動作

無料のUrdu音声認識

اردو

Urdu のオーディオまたはビデオファイルをドロップすると、タイムスタンプ付きの完全な書き起こしが取得できます - すべてブラウザ内で、サインアップ不要です。モデルは一度ダウンロードされ(~75 MB)ローカルにキャッシュされるため、その後の実行は即時でオフラインでも動作します。

ブラウザのサポートを確認しています…

より高い精度や多くの言語が必要ですか?

クラウドベースのUrdu音声認識

無料のブラウザ内ツールは、小規模なオープンソースモデルを実行します。クリーンな音声には適していますが、強いUrduアクセント、ノイズ、または話者の重なりがある場合には苦戦する可能性があり、限られた言語セットしかカバーしていません。放送品質の精度、はるかに幅広い言語サポート、およびSRT/VTT/TXTダウンロードには、有料のクラウドベース音声認識をご利用ください。

クラウドベースの音声認識を試す

仕組み

  1. 1. ファイルをドロップ

    任意のUrduオーディオまたはビデオをドロップしてください - MP3、WAV、M4A、MP4、WEBM はすべてサポートされています。

  2. 2. 文字起こし

    最初のクリックで約75 MBのモデルがブラウザにダウンロードされます。以降は認識が即時でオフライン対応になります。

  3. 3. ダウンロード

    文字起こし結果をTXT、SRT、またはVTTとして保存できます。音声と結果は端末から外に出ることはありません。

音声はお使いの端末にとどまります

認識処理はWebAssemblyを使用して完全にブラウザ内で実行されます。ネットワークへのリクエストはモデルとWebAssemblyランタイムの取得のみで、いずれも公開された静的アセットです。音声も文字起こし結果も当社は参照しません。

ブラウザでUrduの文字起こしを実行する方法

音声認識は通常、音声を誰かのGPUにアップロードすることを意味します。ここでは、モデルがお客様自身のマシンで実行されるため、これは無料でプライベートに利用できます。

Open-source recognition model
多言語オーディオでトレーニングされたオープンソースのニューラルモデルです。そのため、1回のダウンロードでUrduを処理でき、言語固有のモデルをフェッチする必要がありません。
WebAssembly
推論ランタイムはWebAssemblyにコンパイルされているため、数値計算コードはサンドボックス化されたタブ内でプラグインやインストールなしでネイティブに近い速度で実行されます。
On-device inference
約75 MBの量子化モデルが読み込まれ、デコードループは完全にクライアントサイドで駆動されます。ページが読み込まれた後、パイプラインのどの部分もサーバーに呼び出しを行うことはありません。
Web Audio API
ファイルはブラウザ自身のオーディオパイプラインを使用して、モデルが期待する16 kHzモノラルにデコードおよびリサンプリングされるため、ブラウザが再生できるあらゆる形式が受け入れられます。
プレミアム - Subformerからも提供

よくある質問

他の無料の音声認識言語を試す