拖放任意音频或视频文件,选择语言,即可获得带时间戳的完整转录 - 全部在你的浏览器中。模型只下载一次(约75 MB)并本地缓存,因此后续运行即刻可用并支持离线。
识别在本地运行。您的音频永远不会离开您的设备。
模型已缓存在您的浏览器中。后续运行可离线使用。
无需账号、无需积分、无使用上限。即可使用。
语音识别通常意味着将您的音频上传到别人的GPU。而在这里,模型在您自己的机器上运行,这使得该工具既免费又私密。
权衡在于模型大小。设备上的权重只是托管服务运行的一小部分,因此在嘈杂的音频、浓重的口音和重叠的说话者上准确性会下降——这就是下面云选项的用武之地。
免费的浏览器内工具运行一个小型开源模型——对于清晰的音频来说效果不错,但它可能难以处理口音重的、噪音或重叠的说话者,并且只支持有限的语言集。如需广播级准确性、更广泛的语言支持以及SRT/VTT/TXT下载,请使用我们付费的云语音转文本服务。
尝试基于云的语音转文本