음성 인식 엔진과 모델
설정 → STT → 음성 인식 엔진에서 고릅니다.
| 엔진 | 위치 | 필요한 것 | 비고 |
|---|---|---|---|
| WhisperKit (로컬) | Mac 안 | 모델 다운로드 | 튜토리얼에서 모델을 고르면 이 엔진이 됩니다. 실시간 미리보기와 쉼 줄바꿈은 이 엔진에서만 됩니다. |
| MLX Audio (로컬) | Mac 안 | uv 설치 | 튜토리얼을 건너뛰고 uv가 있으면 기본값입니다. 기본 모델은 Qwen3-ASR-1.7B-8bit입니다. |
| Groq Cloud (빠름) | 클라우드 | Groq API 키 | 오디오가 Groq로 전송됩니다. |

WhisperKit 모델 고르기
모델을 고르면 바로 내려받습니다. 진행과 용량은 설정 → 모델 탭에서 확인합니다.
| 모델 | 크기 | 성격 |
|---|---|---|
| Tiny | 약 150MB | 가장 빠르지만 한국어에는 쓰기 어렵습니다. |
| Base | 약 290MB | 고유명사와 전문용어가 자주 틀립니다. |
| Small | 약 970MB | 한국어가 쓸 만해지는 하한입니다. |
| Large v3 Turbo | 약 1.6GB | 기본값. 속도와 정확도의 균형 |
| Large v3 Turbo (v20240930) | 약 1.6GB | 같은 계열의 후속판 |
| Large v3 Turbo 압축 | 약 632MB | 기본값보다 작고 빠릅니다. CPU 사용이 적습니다. |
| Large v3 양자화 | 약 947MB | Large v3를 작게 줄인 판 |
| Large v3 | 약 3.1GB | 가장 정확하고 가장 느립니다. |
전사가 느리면 모델을 키우거나 바꾸기 전에 다른 앱이 CPU를 쓰고 있지 않은지 활동 모니터에서 봅니다. 특정 용어를 자주 틀리면 모델보다 단어사전에 등록하는 편이 빠릅니다.
모델은 ~/Library/Application Support/Sogon/Sogon/Models/whisperkit에 저장됩니다.