Subformer
免費 · 無需註冊 · 在您的瀏覽器執行

免費提供 35+ 種語言的語音轉文字

拖放任何音訊或影片檔,選擇語言,取得含時間戳記的完整逐字稿 - 全在瀏覽器中。模型僅下載一次 (~75 MB),並會快取於本機,後續執行即時且可離線使用。

預設為私密

辨識在本地執行. 你的音訊不會離開裝置.

首次載入後立即可用

模型已緩存在您的瀏覽器中。後續執行可離線運作。

免費,免註冊

無需帳號、無需點數、無使用上限。開放即用。

選擇語言

幕後原理

語音辨識通常意味著將您的音訊上傳到別人的 GPU。在這裡,模型改為在您自己的機器上執行,這使得該工具同時免費且私密。

Open-source recognition model
一個開源神經語音辨識模型的量化版本,體積小到足以一次下載並保留在您的瀏覽器中。
WebAssembly
推論執行階段被編譯為 WebAssembly,因此數值程式碼在沙盒分頁中以接近原生速度執行,無需外掛程式也無需安裝。
On-device inference
載入模型、分詞和執行解碼迴圈都發生在客戶端。頁面載入後,管道的任何部分都不會呼叫伺服器。
Web Audio API
您的檔案會使用瀏覽器自己的音訊管線解碼並重新取樣為模型預期的 16 kHz 單聲道,因此您的瀏覽器可以播放的任何格式都受支援。

取捨在於模型大小。裝置上的權重只是託管服務執行的一小部分,因此在嘈雜的音訊、濃重的口音和重疊的說話者上,準確性會下降 - 這就是下方雲端選項的用武之地。

需要更高的準確度或更多語言嗎?

雲端語音轉文字

免費的瀏覽器內工具運行一個小型開源模型——對於清晰的音訊來說很好,但它可能難以處理濃重的口音、噪音或重疊的說話者,並且只涵蓋有限的語言集。若要獲得廣播級的準確度、更廣泛的語言支援以及 SRT/VTT/TXT 下載,請使用我們付費的雲端語音轉文字服務。

試用雲端語音轉文字