prismBETA
← 개발자 브리핑
2026-07-13 · 03 / 06

Apple SpeechAnalyzer, Whisper Small까지 이긴 온디바이스 실측

Inscribe 팀이 iOS 26·macOS 26의 신규 SpeechAnalyzer API를 구형 SFSpeechRecognizer 및 Whisper 3종과 동일 코드·동일 오디오(M2 Pro, LibriSpeech)로 벤치마크했다. SpeechAnalyzer는 clean 음성 WER을 9.02%→2.12%, noisy를 16.25%→4.56%로 3.5~4배 낮추면서 자신이 대체한 레거시 API보다 정확했고, 자기들이 배포하던 가장 큰 모델인 Whisper Small까지 양쪽 split에서 이기면서 초당 연산은 Small의 약 1/3에 그쳤다. 결론은 명확하다 — SFSpeechRecognizer를 쓰는 앱은 정확도만으로도 마이그레이션할 가치가 있다.

iOS 26·macOS 26에서 Apple은 SFSpeechRecognizer를 SpeechAnalyzer/SpeechTranscriber로 교체하면서 정확도 수치는 전혀 공개하지 않았다. 그래서 이주 여부를 판단하려는 개발자, Whisper와 비교하려는 사람 모두 추측에 의존해야 했다. Inscribe는 이 두 Apple 엔진과 Whisper 3종을 동일 프로덕션 코드 경로에서 같은 M2 Pro(32GB, macOS 26.5.1)와 같은 오디오로 돌려 이 공백을 메웠다.

결과는 레거시 대비 압도적이다. 신규 API는 clean 음성(LibriSpeech test-clean 2,620발화) WER을 9.02%에서 2.12%로, noisy(test-other 2,939발화)를 16.25%에서 4.56%로 3.5~4배 낮췄다. 한 시간짜리 회의를 레거시로 옮기면 SpeechAnalyzer보다 잘못된 단어가 약 4배 많다는 뜻이다. 더 놀라운 건 자기들이 배포하던 가장 큰 모델 Whisper Small마저 두 split에서 넉넉히 이겼고, 그러면서 오디오 초당 연산 시간은 Small의 약 1/3에 그쳤다는 점이다.

다만 Whisper는 여전히 실질적 강점을 남긴다. 영어·Apple 하드웨어라는 조건에서는 내장 엔진이 이제 측정 가능한 최강 온디바이스 옵션이다. 2026-07-15 업데이트로 NVIDIA Parakeet TDT v2/v3와 MOSS-Transcribe-Diarize까지 동일 코퍼스로 추가 측정한 라운드 2도 공개됐다.

투표
정확도 더 좋은 API, 바로 갈아타세요?
이 글이 도움이 되셨나요?
매주 월요일 아침 갱신 · 요약은 AI가 생성하며 출처 원문을 확인하세요.