Перетащите любой аудио- или видеофайл, выберите язык и получите полный транскрипт с отметками времени - всё в вашем браузере. Модель загружается один раз (~75 MB) и кэшируется локально, поэтому последующие запуски мгновенные и работают офлайн.
Распознавание выполняется локально. Ваш аудиофайл никогда не покидает ваше устройство.
Модель кэшируется в вашем браузере. Последующие запуски работают офлайн.
Без аккаунта, без кредитов, без лимитов использования. Откройте и используйте.
Распознавание речи обычно означает загрузку вашего аудио на чей-то GPU. Здесь модель работает на вашей собственной машине, что делает инструмент бесплатным и конфиденциальным одновременно.
Компромисс — размер модели. Веса на устройстве составляют лишь часть того, что использует размещенный сервис, поэтому точность снижается при шумном аудио, сильных акцентах и перекрывающихся голосах — именно здесь облачная опция ниже оправдывает себя.
Бесплатный инструмент в браузере использует небольшую модель с открытым исходным кодом — он хорошо подходит для чистого аудио, но может испытывать трудности с сильными акцентами, шумом или перекрывающимися голосами, а также поддерживает ограниченный набор языков. Для точности вещательного уровня, гораздо более широкой языковой поддержки и загрузки SRT/VTT/TXT используйте наше платное облачное преобразование речи в текст.
Попробовать облачное преобразование речи в текст