본문으로 건너뛰기

음성 인식 엔진과 모델

설정 → STT → 음성 인식 엔진에서 고릅니다.

엔진위치필요한 것비고
WhisperKit (로컬)Mac 안모델 다운로드튜토리얼에서 모델을 고르면 이 엔진이 됩니다. 실시간 미리보기와 쉼 줄바꿈은 이 엔진에서만 됩니다.
MLX Audio (로컬)Mac 안uv 설치튜토리얼을 건너뛰고 uv가 있으면 기본값입니다. 기본 모델은 Qwen3-ASR-1.7B-8bit입니다.
Groq Cloud (빠름)클라우드Groq API 키오디오가 Groq로 전송됩니다.
설정 → STT 탭

WhisperKit 모델 고르기​

모델을 고르면 바로 내려받습니다. 진행과 용량은 설정 → 모델 탭에서 확인합니다.

모델크기성격
Tiny약 150MB가장 빠르지만 한국어에는 쓰기 어렵습니다.
Base약 290MB고유명사와 전문용어가 자주 틀립니다.
Small약 970MB한국어가 쓸 만해지는 하한입니다.
Large v3 Turbo약 1.6GB기본값. 속도와 정확도의 균형
Large v3 Turbo (v20240930)약 1.6GB같은 계열의 후속판
Large v3 Turbo 압축약 632MB기본값보다 작고 빠릅니다. CPU 사용이 적습니다.
Large v3 양자화약 947MBLarge v3를 작게 줄인 판
Large v3약 3.1GB가장 정확하고 가장 느립니다.

전사가 느리면 모델을 키우거나 바꾸기 전에 다른 앱이 CPU를 쓰고 있지 않은지 활동 모니터에서 봅니다. 특정 용어를 자주 틀리면 모델보다 단어사전에 등록하는 편이 빠릅니다.

모델은 ~/Library/Application Support/Sogon/Sogon/Models/whisperkit에 저장됩니다.