Subformer
Бесплатно · Без регистрации · Работает в вашем браузере

Бесплатное распознавание речи на 35+ языках

Перетащите любой аудио- или видеофайл, выберите язык и получите полный транскрипт с отметками времени - всё в вашем браузере. Модель загружается один раз (~75 MB) и кэшируется локально, поэтому последующие запуски мгновенные и работают офлайн.

Приватно по умолчанию

Распознавание выполняется локально. Ваш аудиофайл никогда не покидает ваше устройство.

Мгновенно после первой загрузки

Модель кэшируется в вашем браузере. Последующие запуски работают офлайн.

Бесплатно, без регистрации

Без аккаунта, без кредитов, без лимитов использования. Откройте и используйте.

Выберите язык

Под капотом

Распознавание речи обычно означает загрузку вашего аудио на чей-то GPU. Здесь модель работает на вашей собственной машине, что делает инструмент бесплатным и конфиденциальным одновременно.

Open-source recognition model
Квантованная сборка нейронной модели распознавания речи с открытым исходным кодом, достаточно маленькая, чтобы загрузить один раз и хранить в вашем браузере.
WebAssembly
Среда выполнения вывода скомпилирована в WebAssembly, поэтому числовой код работает почти на нативной скорости внутри изолированной вкладки без плагинов и установки.
On-device inference
Загрузка модели, токенизация и выполнение цикла декодирования — все это происходит на стороне клиента. Ни одна часть конвейера не обращается к серверу после загрузки страницы.
Web Audio API
Ваш файл декодируется и пересэмплируется до моно 16 кГц, ожидаемого моделью, с использованием собственного аудиоконвейера браузера, поэтому принимается любой формат, который ваш браузер может воспроизводить.

Компромисс — размер модели. Веса на устройстве составляют лишь часть того, что использует размещенный сервис, поэтому точность снижается при шумном аудио, сильных акцентах и перекрывающихся голосах — именно здесь облачная опция ниже оправдывает себя.

Нужна более высокая точность или больше языков?

Облачное преобразование речи в текст

Бесплатный инструмент в браузере использует небольшую модель с открытым исходным кодом — он хорошо подходит для чистого аудио, но может испытывать трудности с сильными акцентами, шумом или перекрывающимися голосами, а также поддерживает ограниченный набор языков. Для точности вещательного уровня, гораздо более широкой языковой поддержки и загрузки SRT/VTT/TXT используйте наше платное облачное преобразование речи в текст.

Попробовать облачное преобразование речи в текст