인공지능

Whisper는 얼마나 정확할까? 오디오북부터 회의실까지, 실제 수치로 보기 (2026)

LoroNote 팀20 min

Whisper의 실제 정확도: 깨끗한 낭독 음성에서는 단어 오류율(WER) 약 2~3%, 여러 영어 벤치마크 평균으로는 약 7%, 회의실 녹음에서는 약 16%입니다. 그리고 이 수치를 가장 크게 움직이는 요인이 무엇인지도 함께 정리했습니다.

빠른 결론: Whisper의 정확도를 나타내는 숫자는 하나가 아니라 사다리입니다. 깨끗한 단일 화자 낭독 음성에서 large 모델들은 단어 오류율(WER) 약 2~3% — 100단어 중 97단어 이상을 맞히는 수준 — 에 도달합니다. 실제 영어 벤치마크 여러 개를 섞으면 Whisper Large V3의 평균은 약 7.4%입니다. 마이크가 멀고 화자가 겹치는 회의실 오디오에서는 같은 모델이 약 16%를 기록합니다. 그리고 저자원 언어에서는 오류율이 다시 세 배로 뛸 수 있습니다. Whisper가 ‘정확한가’는 내 녹음이 어느 단에 있는지에 달려 있고, 그만큼이나 — 내가 쓰는 앱이 실제로 어떤 Whisper 변형을 실행하는지에도 달려 있습니다.

이 글의 모든 수치는 OpenAI가 발표한 논문과 모델 카드, 또는 공개된 Open ASR Leaderboard에서 가져왔고 출처는 글 끝에 링크했습니다. 2026년 8월 19일 LoroNote 팀이 작성했습니다. LoroNote는 Whisper Large V3 Turbo를 기기에서 실행하므로 저희도 이해관계가 있습니다 — 바로 그렇기 때문에 아래에 저희 자체 마케팅 수치는 하나도 없습니다.

단어 오류율(WER)은 무엇을 측정하나

WER은 전사가 틀린 단어 — 다른 단어로 바꾸거나, 빠뜨리거나, 지어낸 단어 — 를 실제 발화된 단어 수 대비 비율로 셉니다. WER 5%는 20단어마다 오류 하나, 16%는 여섯 단어마다 하나라는 뜻입니다. 이 정의에서 두 가지가 따라 나옵니다.

  1. WER은 측정에 쓰인 오디오와 나란히 놓아야만 의미가 있습니다. 테스트 세트를 밝히지 않은 “98% 정확도”는 측정이 아니라 슬로건입니다. 같은 모델이 오디오북에서는 97% 이상을, 회의실에서는 84%를 내는데, 어느 쪽도 고장이 아닙니다.
  2. 모든 오류의 비용이 같지 않습니다. 빠진 ‘음…’과 잘못 적힌 약 이름이 똑같이 한 번으로 계산됩니다. WER이 표준 잣대인 이유는 객관적이기 때문이지, 전사문이 얼마나 쓸 만하게 느껴지는지를 담아서가 아닙니다 — 아래에서 다루는 내 오디오로 직접 하는 테스트가 어떤 표보다 나은 이유입니다.

계산 공식과 WER이 100%를 넘는 경우, 그리고 공개 수치를 조용히 움직이는 정규화 단계까지, 전체 정의는 단어 오류율(WER)이란?에서 풀어 정리했습니다.

정확도 사다리: 같은 모델, 네 개의 단

표준 벤치마크에서 Whisper large 모델들이 기록한 공개 수치입니다.

오디오 조건벤치마크대략적인 WER출처
깨끗한 낭독 음성, 단일 화자LibriSpeech test-clean약 2~3%OpenAI Whisper 논문 (large, 2.7%)
실제 영어 오디오 혼합, 테스트 8종Open ASR Leaderboard 평균약 7.4% (Large V3)Open ASR Leaderboard
회의실, 원거리 마이크, 교차 발화AMI 회의 코퍼스약 16% (Large V3)Open ASR Leaderboard
저자원 언어의 예힌디어 (Common Voice)약 27% (Large V3)openai/whisper-large-v3 모델 카드

사다리를 위에서 아래로 읽으면 패턴이 분명합니다. 나빠지는 것은 모델이 아니라 오디오입니다. 입 가까이 든 폰에 하는 받아쓰기는 맨 윗단 근처에 있습니다. 카페 테이블 건너편 인터뷰는 중간쯤입니다. 테이블 끝에서 녹음된 회의는 소프트웨어 선택이 개입하기도 전에 이미 셋째 단에 내려가 있습니다.

어떤 Whisper인가: 변형에 따라 답이 달라집니다

“Whisper 기반”은 모델 하나가 아니라 모델 가족을 가리킵니다. Whisper는 tiny부터 large까지 여러 크기로 배포되고, 크기 사이의 격차가 업체 사이의 격차보다 큽니다.

  • Large V3는 정확도 플래그십입니다. OpenAI는 약하게 라벨링된 오디오 100만 시간과 의사 라벨링된 오디오 400만 시간으로 학습시켰고, 넓은 언어 범위에서 Large V2보다 오류가 10~20% 적다고 보고합니다.
  • Large V3 Turbo는 속도 최적화 파생 모델입니다: 8억 900만 파라미터, 디코더는 32개 레이어에서 4개로 축소. OpenAI는 그 대가를 “경미한 품질 저하”라고 설명합니다 — Open ASR Leaderboard에서 평균은 서로 가깝습니다(평균 WER 약 7.8% vs 7.4%, AMI에서는 약 16.1% vs 16.0%). 언어 전체를 합치면 Large V2와 비슷한 성능이고, 태국어와 광둥어 등 일부 언어에서 가장 많이 잃습니다. 이 트레이드오프는 Whisper Large V3 Turbo 가이드에서 자세히 다뤘습니다.
  • small과 medium은 WER이 몇 퍼센트 포인트 더 높습니다 — 한 문단짜리 테스트로도 보이는 실제 격차입니다. 이 점은 특히 iPhone에서 중요합니다. 잘 알려진 ‘Whisper 앱’ 여러 개가 Mac 버전에서는 large를 돌리면서 폰에서는 small이나 medium을 실행하기 때문입니다. Whisper 앱 비교에 각 iOS 앱이 실제로 로드하는 변형을 정리했습니다.

실용적인 규칙: 앱들을 정확도로 비교하기 전에, 각 앱이 어떤 Whisper를 실행하는지부터 확인하세요. Large V3 Turbo를 돌리는 앱과 small을 돌리는 앱은 — 두 설명문이 ‘Whisper AI’에 대해 뭐라고 하든 — 같은 정확도를 제공하고 있는 것이 아닙니다.

언어는 어떤 소프트웨어 선택보다 수치를 크게 움직입니다

Whisper의 학습 데이터는 고자원 언어에 크게 치우쳐 있고, 정확도도 그 분포를 따라갑니다. 영어, 스페인어, 독일어, 일본어, 한국어 등 데이터가 풍부한 언어는 위 평균 근처에 모입니다. 저자원 언어는 오류율이 훨씬 높습니다 — 표의 힌디어 수치가 공개된 사례 하나이고, OpenAI 모델 카드는 같은 언어 안에서도 억양과 방언에 따라 성능이 고르지 않다고 명시합니다.

Whisper Large V3는 약 100개 언어를 다룹니다(광둥어는 V3에서 추가). 그래서 ‘지원한다’와 ‘똑같이 정확하다’는 서로 다른 주장입니다. 내 언어가 고자원 그룹 밖이라면 정직한 조언은 이 글 내내 한 말과 같습니다. 짧은 녹음을 직접 돌려 결과를 보세요 — 전체 언어 목록은 LoroNote가 무엇을 시도할지 알려 주고, 내 오디오 2분은 얼마나 잘하는지를 알려 줍니다.

환각: WER이 과소평가하는 오류

OpenAI 모델 카드는 직설적으로 명시합니다. 대규모의 노이즈 섞인 데이터로 학습했기 때문에 “예측에 오디오 입력에서 실제로 발화되지 않은 텍스트가 포함될 수 있다(즉, 환각)“는 것입니다. 실제로는 무음, 배경 소음, 음악 구간에서 나타납니다 — Whisper는 생성형 모델이라, 붙들 음성이 없으면 아무도 하지 않은 유창한 문장을 만들어 낼 수 있습니다.

이를 관리 가능하게 만드는 두 가지:

  • 앱이 완화할 수 있습니다. 무음 구간을 건너뛰는 음성 활동 감지(VAD)는 모델이 텍스트를 지어낼 주된 기회를 없앱니다. 이것은 모델 설정이 아니라 앱 수준의 동작이고, 같은 Whisper를 돌리는 앱들 사이의 실질적인 차이 중 하나입니다.
  • 직접 알아볼 수 있습니다. 환각된 텍스트는 조용했다고 알고 있는 구간 — 녹음 끝, 긴 침묵 — 에 나타나는 경향이 있습니다. 전사문의 중간은 탄탄한데 침묵 구간에 문장이 생겨나 있다면, 잘못 들은 것이 아니라 환각을 보고 있는 것입니다.

이 동작을 트랜스듀서 아키텍처 모델과 비교한 글이 Parakeet V3 vs Whisper Large V3입니다 — 트랜스듀서는 무음에서 환각이 적고, Whisper는 훨씬 많은 언어를 다룹니다. 양쪽을 다 가진 모델은 없습니다.

내 녹음에서 정확도를 실제로 움직이는 것들

벤치마크 사이의 차이는 결국 오디오의 차이이고, 내 녹음의 결과를 가르는 것도 같은 요인들입니다. 대략적인 영향 순서로:

  1. 마이크 거리. 가장 큰 지렛대입니다. 테이블 위 팔 뻗으면 닿는 거리의 폰은 방 건너편의 폰을 이기고, 그 격차는 어떤 모델 업그레이드보다 큽니다.
  2. 소음과 음악. 일정한 배경 소음은 완만하게, 음악과 덜그럭거림은 심하게 성능을 떨어뜨립니다.
  3. 화자 겹침. 회의 코퍼스가 약 16%, 단일 화자 오디오가 약 3%인 이유가 바로 교차 발화입니다.
  4. 전문 용어. 이름, 약물명, 종목 코드, 전문 용어는 유난히 자주 틀립니다. LoroNote의 사용자 사전은 정확히 이를 위해 존재합니다: 더는 틀리면 안 되는 반복 용어들.
  5. 모델 변형 — 위 요인 중 유일하게 순수한 소프트웨어 선택이고, LoroNote가 폰에서 실행 가능한 가장 큰 Whisper 변형을 돌리는 이유입니다.

화자 라벨은 따로 언급할 가치가 있습니다. 화자 분리는 WER을 바꾸지 않지만, 다중 화자 전사문이 애초에 쓸 만한지를 바꿉니다. 화자 없는 정확한 전사문은 여전히 숙제입니다 — 화자 식별의 원리가 문제의 나머지 절반을 다룹니다.

10분 만에 직접 Whisper 정확도를 측정하는 방법

내 오디오로 하는 테스트가 이 글의 어떤 표보다 우선합니다.

  1. 실제 사용과 닮은 2분 정도를 녹음하세요 — 같은 방, 같은 거리, 같은 언어, 실제 이름과 전문 용어로. 보통 말 속도라면 2분에 250단어 안팎이 나와, 아래의 200단어 세기에 충분합니다.
  2. 전사한 뒤 오디오와 대조하며 결과를 읽으세요.
  3. 200단어 구간에서 오류를 세세요: 바뀐 단어, 빠진 단어, 지어낸 단어 전부. 오류 수 ÷ 200 = 나의 WER.
  4. 개수만이 아니라 오류의 질을 판단하세요: 뭉개진 추임새 다섯 개와 뭉개진 고객 이름 다섯 개는 WER은 같아도 업무에 미치는 타격이 전혀 다릅니다.

무엇을 오류로 셀지 미리 정하는 기준까지 포함한 이 방법의 정밀한 버전은 단어 오류율(WER) 가이드에 있습니다.

LoroNote는 무료로 다운로드할 수 있고, 무료 버전은 어떤 녹음이든 처음 2분을 전사합니다 — 정확히 이 테스트에 필요한 만큼입니다. 전사는 기기에서 이루어지므로 녹음은 iPhone을 떠나지 않습니다 — 업로드 단계도, 계정도 없고, 에어플레인 모드여도 달라지는 것이 없습니다.

자주 묻는 질문

Whisper는 업무용 전사에 쓸 만큼 정확한가요?

가까운 마이크로 깨끗하게 녹음된 고자원 언어라면, Whisper large 모델은 대부분의 사람이 가볍게만 손보는 초안을 만들어 냅니다 — 깨끗한 음성에서의 WER 2~3%는 자동 시스템의 실질적 상한에 가깝습니다. 마이크가 먼 회의, 심한 교차 발화, 정확한 워딩이 중요한 자리라면 검토 시간을 미리 잡아 두세요. WER 16%에서는 여섯 단어 중 하나를 직접 확인해야 합니다.

Whisper Large V3 Turbo는 Large V3보다 정확도가 떨어지나요?

약간 떨어집니다. OpenAI는 저하를 경미하다고 표현하고, 공개 리더보드의 영어 평균은 1퍼센트 포인트 이내로 붙어 있습니다. 언어 전체를 합치면 Turbo는 Large V2와 비슷한 성능이고, 태국어와 광둥어 등 일부 언어에서 가장 많이 잃습니다. 그 대신 극적으로 빨라집니다 — Large 계열 모델을 폰에서 실용적으로 만들어 준 것이 바로 이 맞바꿈입니다.

아무도 말하지 않은 문장이 전사문에 왜 들어 있나요?

그것이 환각입니다. 무음, 소음, 음악에서 나타나는 Whisper의 문서화된 동작으로, 붙들 음성이 없는 생성형 모델이 그래도 유창한 텍스트를 만들어 내는 현상입니다. 녹음의 조용한 구간을 확인해 보세요. Whisper 앞에 음성 활동 감지를 돌리는 앱은 이를 대부분 피합니다 — 사용자 설정이 아니라 앱의 동작입니다.

온디바이스로 Whisper를 돌리면 정확도가 떨어지나요?

아니요. 같은 모델 가중치는 어디에서 실행되든 같은 전사 품질을 냅니다. 온디바이스 추론이라고 품질이 깎이는 것이 아닙니다. 앱 사이에서 달라지는 것은 어떤 변형을 돌리느냐입니다 — 클라우드 서비스는 가장 큰 모델을 쉽게 올릴 수 있는 반면, 온디바이스 앱은 폰에 맞아야 해서 일부는 small이나 medium을 돌립니다. LoroNote는 Large V3 Turbo를 로컬에서 실행해, Large 계열 모델과 온디바이스 프라이버시를 한 앱에 담습니다.

결론

“Whisper는 얼마나 정확한가”의 답은 숫자 하나가 아니라 분포입니다. 깨끗한 낭독 음성에서 WER 약 2~3%, 혼합 영어 벤치마크에서 약 7%, 회의 오디오에서 약 16%, 저자원 언어에서는 그보다 나쁘고 — 여기에 WER이 과소평가하는 환각이라는 변수가 있습니다. 내 결과를 가장 크게 움직이는 두 선택은 물리적인 것(마이크를 가까이)과 구조적인 것(내 앱이 어떤 Whisper 변형을 돌리는지 아는 것)입니다. 나머지는 내 녹음으로 10분이면 측정할 수 있습니다. 처음부터 나를 위한 것이었던 유일한 벤치마크입니다.

공식 자료

당신의 목소리를 텍스트로 — 오프라인에서

LoroNote는 회의·강의·인터뷰를 iPhone에서 바로 전사합니다. 프라이빗하고, 정확하고, 무제한으로.

App Store에서 다운로드