任意のオーディオまたはビデオファイルをドロップし、言語を選択すると、タイムスタンプ付きの完全な書き起こしが得られます - すべてブラウザ内で行われます。モデルは一度ダウンロードされ(~75 MB)ローカルにキャッシュされるため、その後の実行は即時かつオフラインで動作します。
認識はローカルで実行されます。あなたの音声は端末から外に出ることはありません。
モデルはブラウザにキャッシュされます。以降の実行はオフラインで動作します。
アカウント不要、クレジット不要、使用上限なし。開いてすぐに使えます。
音声認識は通常、音声を誰かのGPUにアップロードすることを意味します。ここでは、モデルがお客様自身のマシンで実行されるため、このツールは無料でプライベートに利用できます。
トレードオフはモデルサイズです。デバイス上の重みはホスト型サービスが実行するもののほんの一部であるため、ノイズの多いオーディオ、強いアクセント、話者の重なりがある場合には精度が低下します。これが、以下のクラウドオプションがその価値を発揮する場面です。
無料のブラウザ内ツールは、小規模なオープンソースモデルを実行します。クリーンな音声には適していますが、強いアクセント、ノイズ、または話者の重なりがある場合には苦戦する可能性があり、限られた言語セットしかカバーしていません。放送品質の精度、はるかに幅広い言語サポート、およびSRT/VTT/TXTダウンロードには、有料のクラウドベース音声認識をご利用ください。
クラウドベースの音声認識を試す