Subformer
免费 · 无需注册 · 在浏览器中运行

免费Farsi语音转文字

فارسی

拖放一个Farsi音频或视频文件并获得带时间戳的完整转录 - 全部在你的浏览器中,无需注册。模型只下载一次(约75 MB)并本地缓存,因此后续运行瞬间完成并可离线使用。

正在检查浏览器支持…

需要更高的准确性或更多语言吗?

基于云的Farsi语音转文本

免费的浏览器内工具运行一个小型开源模型——对于清晰的音频来说效果不错,但它可能难以处理口音重的Farsi、噪音或重叠的说话者,并且只支持有限的语言集。如需广播级准确性、更广泛的语言支持以及SRT/VTT/TXT下载,请使用我们付费的云语音转文本服务。

尝试基于云的语音转文本

工作原理

  1. 1. 拖放文件

    拖入任何Farsi音频或视频 - MP3、WAV、M4A、MP4 和 WEBM 均受支持。

  2. 2. 转录

    首次点击会将约75 MB 的模型下载到你的浏览器。之后,识别即时且支持离线。

  3. 3. 下载

    将转录保存为 TXT、SRT 或 VTT。您的音频和结果不会离开您的设备。

您的音频保留在设备上

识别完全在您的浏览器中运行,使用 WebAssembly。唯一的网络请求是获取模型和 WebAssembly 运行时 - 它们都是公开的静态资源。我们看不到您的音频,也看不到转录文本。

Farsi转录如何在您的浏览器中运行

语音识别通常意味着将您的音频上传到别人的GPU。而在这里,模型在您自己的机器上运行,这使得它既免费又私密。

Open-source recognition model
一个在多语言音频上训练的开源神经模型——这就是为什么一次下载即可处理Farsi,无需获取特定语言的模型。
WebAssembly
推理运行时被编译为 WebAssembly,因此数值代码在沙盒标签页内以接近原生速度运行,无需插件,也无需安装。
On-device inference
加载约75 MB的量化模型,解码循环完全由客户端驱动。页面加载后,管道的任何部分都不会调用服务器。
Web Audio API
您的文件会使用浏览器自身的音频管道解码并重采样为模型所需的 16 kHz 单声道,因此您的浏览器可以播放的任何格式都受支持。
高级版 - 同样由 Subformer 提供

常见问题

尝试其他免费语音转写语言