Subformer
無料 · サインアップ不要 · ブラウザ上で動作

無料の音声認識(35+ 言語対応)

任意のオーディオまたはビデオファイルをドロップし、言語を選択すると、タイムスタンプ付きの完全な書き起こしが得られます - すべてブラウザ内で行われます。モデルは一度ダウンロードされ(~75 MB)ローカルにキャッシュされるため、その後の実行は即時かつオフラインで動作します。

デフォルトで非公開

認識はローカルで実行されます。あなたの音声は端末から外に出ることはありません。

初回読み込み後は即時

モデルはブラウザにキャッシュされます。以降の実行はオフラインで動作します。

無料、サインアップ不要

アカウント不要、クレジット不要、使用上限なし。開いてすぐに使えます。

言語を選択

内部の仕組み

音声認識は通常、音声を誰かのGPUにアップロードすることを意味します。ここでは、モデルがお客様自身のマシンで実行されるため、このツールは無料でプライベートに利用できます。

Open-source recognition model
オープンソースのニューラル音声認識モデルの量子化ビルドで、一度ダウンロードすればブラウザに保存できるほど小さいです。
WebAssembly
推論ランタイムはWebAssemblyにコンパイルされているため、数値計算コードはサンドボックス化されたタブ内でプラグインやインストールなしでネイティブに近い速度で実行されます。
On-device inference
モデルの読み込み、トークン化、デコードループの実行はすべてクライアントサイドで行われます。ページが読み込まれた後、パイプラインのどの部分もサーバーに呼び出しを行うことはありません。
Web Audio API
ファイルはブラウザ自身のオーディオパイプラインを使用して、モデルが期待する16 kHzモノラルにデコードおよびリサンプリングされるため、ブラウザが再生できるあらゆる形式が受け入れられます。

トレードオフはモデルサイズです。デバイス上の重みはホスト型サービスが実行するもののほんの一部であるため、ノイズの多いオーディオ、強いアクセント、話者の重なりがある場合には精度が低下します。これが、以下のクラウドオプションがその価値を発揮する場面です。

より高い精度や多くの言語が必要ですか?

クラウドベースの音声認識

無料のブラウザ内ツールは、小規模なオープンソースモデルを実行します。クリーンな音声には適していますが、強いアクセント、ノイズ、または話者の重なりがある場合には苦戦する可能性があり、限られた言語セットしかカバーしていません。放送品質の精度、はるかに幅広い言語サポート、およびSRT/VTT/TXTダウンロードには、有料のクラウドベース音声認識をご利用ください。

クラウドベースの音声認識を試す