Subformer
무료 · 회원가입 불필요 · 브라우저에서 실행

무료 음성 인식 - 35+개 언어

어떤 오디오나 비디오 파일이든 드롭하고 언어를 선택하면 타임스탬프가 포함된 전체 대본을 브라우저에서 받을 수 있습니다 - 모두 브라우저 내에서 진행됩니다. 모델은 한 번 (~75 MB) 다운로드되어 로컬에 캐시되므로 이후 실행은 즉시 이루어지며 오프라인에서도 작동합니다.

기본적으로 비공개

인식은 로컬에서 실행됩니다. 귀하의 오디오는 기기를 벗어나지 않습니다.

첫 로드 후 즉시

모델이 브라우저에 캐시됩니다. 이후 실행은 오프라인에서 작동합니다.

무료, 가입 불필요

계정 불필요, 크레딧 불필요, 사용량 제한 없음. 바로 사용하세요.

언어 선택

내부 작동 방식

음성 인식은 일반적으로 오디오를 다른 사람의 GPU에 업로드하는 것을 의미합니다. 여기서는 모델이 사용자 자신의 기기에서 실행되므로, 이 도구가 무료이면서 동시에 비공개로 유지됩니다.

Open-source recognition model
오픈 소스 신경망 음성 인식 모델의 양자화된 빌드로, 한 번 다운로드하여 브라우저에 보관할 수 있을 만큼 작습니다.
WebAssembly
추론 런타임은 WebAssembly로 컴파일되어 숫자 코드가 플러그인이나 설치 없이 샌드박스 탭 내에서 거의 기본 속도로 실행됩니다.
On-device inference
모델 로드, 토큰화, 디코딩 루프 실행은 모두 클라이언트 측에서 이루어집니다. 페이지가 로드된 후에는 파이프라인의 어떤 부분도 서버를 호출하지 않습니다.
Web Audio API
파일은 브라우저 자체 오디오 파이프라인을 사용하여 모델이 예상하는 16kHz 모노로 디코딩 및 리샘플링되므로, 브라우저가 재생할 수 있는 모든 형식이 허용됩니다.

절충점은 모델 크기입니다. 장치 내 가중치는 호스팅 서비스가 실행하는 것의 일부에 불과하므로 시끄러운 오디오, 강한 악센트, 겹치는 화자에서는 정확도가 떨어집니다. 이것이 아래 클라우드 옵션이 필요한 이유입니다.

더 높은 정확도 또는 더 많은 언어가 필요하신가요?

클라우드 기반 음성 텍스트 변환

무료 인브라우저 도구는 작은 오픈소스 모델을 실행합니다. 깨끗한 오디오에는 좋지만, 심한 악센트, 소음 또는 겹치는 화자가 있는 경우 어려움을 겪을 수 있으며 제한된 언어만 지원합니다. 방송 품질의 정확도, 훨씬 더 광범위한 언어 지원, SRT/VTT/TXT 다운로드를 원하시면 유료 클라우드 기반 음성 텍스트 변환을 사용하세요.

클라우드 기반 음성 텍스트 변환 시도