Subformer
免费 · 无需注册 · 在浏览器中运行

支持35+种语言的免费语音转文字

拖放任意音频或视频文件,选择语言,即可获得带时间戳的完整转录 - 全部在你的浏览器中。模型只下载一次(约75 MB)并本地缓存,因此后续运行即刻可用并支持离线。

默认私有

识别在本地运行。您的音频永远不会离开您的设备。

首次加载后即时

模型已缓存在您的浏览器中。后续运行可离线使用。

免费,无需注册

无需账号、无需积分、无使用上限。即可使用。

选择语言

幕后原理

语音识别通常意味着将您的音频上传到别人的GPU。而在这里,模型在您自己的机器上运行,这使得该工具既免费又私密。

Open-source recognition model
一个量化的开源神经语音识别模型,体积小到足以一次下载并保留在您的浏览器中。
WebAssembly
推理运行时被编译为 WebAssembly,因此数值代码在沙盒标签页内以接近原生速度运行,无需插件,也无需安装。
On-device inference
模型加载、分词和解码循环都在客户端进行。页面加载后,管道的任何部分都不会调用服务器。
Web Audio API
您的文件会使用浏览器自身的音频管道解码并重采样为模型所需的 16 kHz 单声道,因此您的浏览器可以播放的任何格式都受支持。

权衡在于模型大小。设备上的权重只是托管服务运行的一小部分,因此在嘈杂的音频、浓重的口音和重叠的说话者上准确性会下降——这就是下面云选项的用武之地。

需要更高的准确性或更多语言吗?

基于云的语音转文本

免费的浏览器内工具运行一个小型开源模型——对于清晰的音频来说效果不错,但它可能难以处理口音重的、噪音或重叠的说话者,并且只支持有限的语言集。如需广播级准确性、更广泛的语言支持以及SRT/VTT/TXT下载,请使用我们付费的云语音转文本服务。

尝试基于云的语音转文本