AI 뉴스로 돌아가기

오픈 ASR 리더보드에 첫 번째 남반구 언어가 추가

Voice Arena와 Hugging Face, 힌디어 및 인도 영어 대상 공개 ASR 평가 출시를 위해 협력

2026.08.2822원문 보기
Voice Arena와 Hugging Face, 힌디어 및 인도 영어 대상 공개 ASR 평가 출시를 위해 협력
벤치마크는 어떤 기술이 개발될지를 결정합니다. Open ASR 리더보드에서 높은 점수를 받은 모델은 채택되어 지속적으로 개선되는 반면, 리더보드에서 측정하지 않는 기능은 발전하지 않는 경향이 있습니다. 최근 리더보드 관련 연구의 상당 부분은 평가 지표의 신뢰성을 높이는 데 집중되어 왔습니다:

홀드아웃된 비공개 분할.
모델이 단순히 오디오를 전사하는 것이 아니라 참조 대본을 얼마나 정확히 재현하는지 정량화하기 위한 벤치마크 적합도 분석.
올바른 예측이나 변형이 불이익을 받지 않도록 정규화 알고리즘의 한계를 보완.
이러한 모든 노력 덕분에 단일 수치(WER)를 조작하기가 더 어려워졌습니다. 하지만 여전히 하나의 수치일 뿐입니다. 수많은 연구를 통해 ASR 오류율이 사용자에 따라 고르게 분포되지 않는다는 사실이 밝혀졌습니다. 자동 음성 인식(ASR)의 인종 간 격차 연구에 따르면, 상용 시스템은 흑인 화자의 경우 백인 화자에 비해 약 두 배나 더 낮은 성능을 보였으며, 『자동 음성 인식의 편향 정량화(Quantifying Bias in Automatic Speech Recognition)』 연구에서는 성별, 연령, 억양에 따른 추가적인 차이도 발견되었습니다. 이러한 사실들은 리더보드에서는 전혀 드러나지 않는데, 이는 리더보드가 이를 의도적으로 숨기기 때문이 아닙니다. 리더보드에서 실행되는 테스트 세트는 말한 내용만 기록할 뿐, 누가 말했는지에 대한 정보는 거의 포함하지 않기 때문입니다.

이러한 격차를 해소하기 위해, 우리는 Open ASR 리더보드에 ‘Monsoon en-IN’과 ‘Monsoon hi-IN’이라는 두 가지 평가 데이터 세트를 도입합니다. 5억 명 이상이 사용하는 힌디어는 현재 유럽 언어만 다루고 있는 다국어 탭에 포함된 최초의 인도계 언어입니다. 각 데이터 세트는 자체 점수 산출이 가능한 공개 분할(public split)과 벤치마크 특화 최적화를 제한하기 위해 비공개로 유지되는 비공개 분할(private split)로 제공됩니다. 네 가지 스플릿은 화자가 서로 겹치지 않으며, 총 4,888명의 화자로 구성되어 있고, 각 화자에 대해 12가지 화자 속성이 기록되어 있습니다.

데이터 세트 설계
테스트 세트는 그 변동 범위에 해당하는 오류 모드만 드러낼 수 있습니다. 대부분의 벤치마크는 손쉽게 구할 수 있는 오디오 자료를 바탕으로 구축됩니다. Monsoon은 지리적 위치, 연령, 성별, 어휘, 기기, 음향 환경, 화법, 말하기 속도, 동일한 오디오에 대한 여러 개의 유효한 전사본 존재 여부 등 9가지 축을 따라 변동되도록 설계되었습니다. 각 축은 전체 WER(오류율)이 평균적으로는 정확할 수 있지만 특정 집단에 대해서는 부정확할 수 있는 요인입니다.



데이터 수집 방법도 이러한 설계 원칙에 따라 결정됩니다.

지리적 요인은 소수의 장소에서 장시간 녹음하는 대신 수백 개의 구역에 걸쳐 참여자를 모집함으로써 확보되었습니다.
기기 및 음향 조건은 조용한 방에서 제공된 하드웨어를 사용하는 대신, 참여자들이 실내외에서 각자의 휴대폰과 네트워크 연결을 사용함으로써 확보되었습니다.
어휘, 화법 유형 및 말하기 속도는 프롬프트에서 비롯됩니다. 일상적인 주제를 통해 참여자들이 의견을 제시하거나, 반박하거나, 이야기를 풀어내거나, 기억을 되살리도록 유도함으로써 명명된 개체, 숫자, 즉흥적인 표현이 자연스럽게 등장하게 됩니다.
연령과 성별은 화자별로 기록되며 검증됩니다.
여러 개의 유효한 전사본이 존재한다는 점은 오디오 자체가 아닌 참조 자료의 특성이며, 이는 후술할 섹션의 주제입니다.
데이터셋 구성
4개의 분할, 2개 언어, 단일 파이프라인을 통해 수집되었습니다.

세트    언어    총 시간    화자 수    클립 길이 (평균 / 중앙값)    남/여    지구    주/연합영토    기기    스타일    전사본
Monsoon en-IN public    인도 영어    5.62시간    1,444    9.6초 / 10.4초    50/50    428    24/6    556    대화형, 자연발화    정규화, 유창성 장애 포함
Monsoon en-IN private    인도 영어    5.58시간    1,405    9.6초 / 10.4초 45/55    420    24/6    560    대화형, 자연스러운    정규화, 유창성 장애
Monsoon hi-IN public    힌디어    1.33시간    468    6.4초 / 5.0초    54/46    202    11/3    315    대화형, 자연스러운    격자 모델 (허용된 표기 변형)
Monsoon hi-IN 사적    힌디어    4.47시간    1,571    6.6초 / 5.3초    55/45    295    12/3    582    대화형, 자연발화    래티스 (허용되는 표기 변형 포함)
이 데이터는 대본 없이 진행된 이중 채널 자연발화 대화에서 수집되었으며, 각 클립이 한 명의 화자를 포함하도록 단일 채널에서 클립을 분할했습니다. 표에 기재된 항목 외에도, 각 클립에는 직업, 학력, 결혼 여부, 소득대, 휴대폰 브랜드, 현재 거주 도시 및 현재 거주 지역에서 거주한 기간이 기록되어 있습니다.

공개된 인도 영어 데이터 세트에서 추출한 5개의 클립과 각 클립에 포함된 메타데이터는 다음과 같습니다:

29세 여성, 서부 트리푸라, 트리푸라. 학생, 삼성 SM-G781B.


32세 여성, 마디아프라데시주 사트나. 무직, 삼성 SM-E146B.


22세 남성, 비하르주 로타스. 학생, 모토로라 모토 G54 5G.


27세 여성, 텔랑가나주 와랑갈. 무직, 비보 V2247.


57세 남성, 푸두체리. 민간 기업 재직, 샤오미 M2006C3LI.


영어 데이터 세트는 표준 문자열 참조를 사용하며, 리더보드의 정규화기는 대부분의 철자 변형을 통합합니다. 힌디어는 철자 변형이 훨씬 더 많으며, 변형들이 두 가지 규칙 간의 고정된 대응 관계가 아니기 때문에 어떤 정규화기도 이를 해결할 수 없습니다. 따라서 힌디어 데이터 세트에는 격자(lattice)가 포함되어 있습니다. 즉, 전사본의 각 구간마다 올바르다고 인정되는 철자 목록이 제공됩니다.

화자 범위
Monsoon은 시간 단위로 측정하면 규모가 작지만, 화자 수로 측정하면 규모가 큽니다. 이것이 바로 설계 의도이며, 여기에서 대부분의 가치가 창출됩니다.

상기 분야를 넘어선 화자의 집중도와 다양성.

Monsoon hi-IN 공공    Monsoon hi-IN 민간