벤치마크는 어떤 기능을 개발할지 결정합니다. 오픈 ASR 리더보드 에서 높은 점수를 받은 모델은 채택되어 개선되는 반면, 리더보드에서 측정하지 않는 기능은 개선되지 않는 경향이 있습니다. 최근 리더보드 관련 작업의 상당 부분은 평가 지표의 신뢰성을 높이는 데 집중되었습니다.
- 비공개 분할을 미뤄왔습니다 .
- 벤치마크 적합 분석을 통해 모델이 오디오만을 기반으로 전사하는 것이 아니라 참조 전사본을 얼마나 잘 재현하는지 정량화합니다.
- 정규화기의 부족한 부분을 보완하여 정확한 예측/변형에 불이익이 가지 않도록 합니다.
이 모든 것 때문에 하나의 수치(WER)를 조작하기가 더 어려워집니다. 하지만 여전히 하나의 수치일 뿐입니다. 오랜 연구를 통해 ASR 오류율이 사용자마다 고르게 분포되어 있지 않다는 사실이 밝혀졌습니다. 자동 음성 인식에서 인종적 불균형이 존재 하며, 상용 시스템은 백인 화자에 비해 흑인 화자의 경우 오류율이 약 두 배나 더 높은 것으로 나타났습니다. 또한, 자동 음성 인식의 편향을 정량화한 연구에서는 성별, 연령, 억양에 따른 차이도 추가로 발견되었습니다. 이러한 모든 정보는 순위표에 나타나지 않는데, 순위표 자체가 이를 숨기고 있어서가 아닙니다. 테스트 세트는 어떤 말이 오갔는지만 누가 말했는지는 거의 기록하지 않기 때문입니다.
이러한 격차를 해소하기 위해 Open ASR Leaderboard에 Monsoon en-IN 과 Monsoon hi-IN이라는 두 가지 평가 데이터셋을 추가했습니다. 5억 명이 넘는 사람들이 사용하는 힌디어는 현재 유럽 언어만 지원하는 다국어 탭에 추가된 최초의 인도어입니다. 각 데이터셋은 자체 평가에 사용할 수 있는 공개 분할 데이터셋과 벤치마크별 최적화를 제한하기 위한 비공개 분할 데이터셋으로 제공됩니다. 네 개의 분할 데이터셋은 각각 화자가 분리되어 있으며, 총 4,888명의 화자와 12개의 화자 속성이 기록되어 있습니다.
컬렉션 디자인
테스트 세트는 변동성이 큰 특정 오류 모드만 드러낼 수 있습니다. 대부분의 벤치마크는 손쉽게 구할 수 있는 오디오 데이터로 구축됩니다. Monsoon은 지리적 위치, 연령, 성별, 어휘 수준, 사용 기기, 음향 환경, 음성 유형, 음성 속도, 그리고 동일한 오디오에 대한 유효한 전사본이 여러 개 존재하는지 여부 등 9가지 축을 기준으로 변동성을 고려하여 구축되었습니다. 각각의 축은 전체 WER(단어 오류율)이 평균적으로는 정확하지만 특정 인구 집단에서는 잘못될 수 있는 요인입니다.
수집 방법은 그에 따라 달라집니다.
- 지리적 범위는 소수의 장소에서 장시간 세션을 녹화하는 방식이 아니라 수백 개의 지역에 걸쳐 모집 활동을 하는 데서 비롯됩니다.
- 기기 및 음향 조건은 조용한 방에서 제공된 하드웨어를 사용하는 대신, 참여자들이 실내외에서 자신의 휴대폰과 연결 장치를 사용하는 방식으로 수집되었습니다.
- 어휘, 말의 유형, 말 속도는 제시된 일상적인 주제에서 비롯됩니다. 이러한 주제들은 참가자들이 의견을 제시하거나, 반대 의견을 내거나, 이야기를 하거나, 과거를 회상하도록 유도하며, 그 과정에서 명사, 숫자, 즉흥적인 표현이 나타납니다.
- 화자의 나이와 성별은 기록 및 검증됩니다.
- 유효한 녹취록이 여러 개 존재 한다는 것은 오디오 자체의 속성이 아니라 참조 자료의 속성이며, 이는 이후 섹션에서 자세히 다룹니다.
데이터셋 구성
네 개의 분할, 두 개의 언어, 하나의 파이프라인을 통해 수집되었습니다.
이 데이터는 대본 없이 녹음된 자연스러운 양방향 대화에서 추출되었으며, 각 클립에는 한 명의 화자만 포함되도록 단일 채널에서 여러 클립으로 분할되었습니다. 표에 제시된 항목 외에도 각 클립에는 직업, 학력, 결혼 여부, 소득 수준, 휴대폰 브랜드, 현재 거주 도시 및 현재 지역 거주 기간이 기록됩니다.
공개된 인도 영어 분할 영상 클립 5개와 각 클립에 포함된 메타데이터:
트리푸라 주 서부 트리푸라에 거주하는 29세 여성. 학생, 삼성 SM-G781B 휴대폰 사용.
32세 여성, 마디아프라데시주 사트나 거주. 무직, 삼성 SM-E146B 휴대폰 사용.
22세 남성, 비하르주 로타스. 학생, 모토로라 모토 g54 5G.
27세 여성, 텔랑가나주 와랑갈 거주. 무직, vivo V2247 사용.
57세 남성, 푸두체리 거주. 개인 업무용, 샤오미 M2006C3LI 휴대폰 사용.
영어 데이터 세트는 표준 문자열 참조를 사용하며, 리더보드 정규화 도구가 대부분의 철자 변형을 통합합니다. 힌디어는 훨씬 더 많은 변형이 존재하며, 두 표기법 간의 고정된 대응 관계가 없기 때문에 어떤 정규화 도구도 이를 해결할 수 없습니다. 따라서 힌디어 데이터 세트는 각 전사본 구간에 대해 올바른 것으로 인정되는 철자 목록을 제공하는 격자 구조를 사용합니다.
스피커 커버리지
몬순은 시간 단위로는 짧지만 스피커 수로는 방대합니다. 이것이 바로 설계 의도이며, 대부분의 가치가 여기에 있습니다.
발표자 집중도 및 다양성은 위 분야를 넘어섭니다.
다음은 세 가지 속성이며, 각각은 부피가 아닌 분산에 관한 주장입니다.
어느 한 목소리가 점수를 좌우하는 것은 아닙니다. 가장 많은 음성을 제공한 상위 10명의 목소리는 전체 음성 길이의 2.8%에서 6.8% 사이이며, 전체 화자의 절반 이상이 정확히 한 번만 등장합니다. Monsoon의 결과는 소수의 화자가 장시간 녹음한 음성이 아니라 수백 개의 서로 다른 목소리를 평균낸 것입니다. 일반적으로 비슷한 길이의 테스트 세트는 이와 반대로 구성됩니다.
특정 지역이나 단말기에 국한되지 않습니다. 인도 영어 공용 데이터셋은 30개 주와 연방 직할령에 걸쳐 428개 지역의 데이터를 활용했으며, 힌디어 데이터셋은 힌디어 사용 지역 특성상 더 집중되어 있지만 각각 202개와 295개 지역을 포함합니다. 녹음 데이터는 315개에서 582개에 이르는 다양한 기기 모델에서 수집되었으며, 어떤 하위 집합에서도 단일 모델이 전체 세그먼트의 2.1%를 초과하지 않습니다. 표준화된 하드웨어에서 수집된 코퍼스는 하나의 마이크 응답에 과적합되는 경향이 있지만, 이 코퍼스는 그렇지 않습니다.
여기서 말하는 인도 영어는 하나의 억양이 아닙니다. 특정 지역의 영어가 아니라 인도 전역에서 사용되는 영어입니다. 6개 지역 모두가 포함되어 있으며, 공개된 데이터 세트에서는 남부 지역 화자가 35%, 동부 지역 화자가 18%, 중부 지역 화자가 18%, 북부 지역 화자가 16%, 서부 지역 화자가 11%를 차지합니다. 이러한 지역적 분포로 인한 억양 차이는 메타데이터에 기록되어 있으며, 별도로 명시되지는 않습니다.
메타데이터 필드
Monsoon은 세그먼트당 18개의 열을 전송하며, 그중 12개는 메타데이터입니다. 대부분의 공개 ASR 테스트 세트는 식별자, 전사본 및 지속 시간을 전송합니다. 인구 통계 필드는 완전하거나 거의 완전하며, 참여자들은 이러한 사용에 동의했습니다.
두 언어는 지리적 분포 형태가 다르며, 이러한 형태는 많은 것을 시사합니다. 힌디어 데이터셋은 힌디어 사용 지역에 집중되어 있으며, 우타르프라데시 주가 전체 화자의 약 40%를 차지하는데, 이는 인구수를 기준으로 표본 추출한 힌디어 코퍼스의 전형적인 모습입니다. 인도 영어 데이터셋은 훨씬 더 고르게 분포되어 있습니다. 어느 주도 13%를 넘지 않으며, 화자의 3분의 1은 인구 규모가 가장 큰 8개 주 이외의 지역에서 나옵니다. 두 언어 모두 공공 부문과 민간 부문 화자의 비율이 매우 유사합니다.
인도의 주 경계는 언어적 특징을 따라 설정되었기 때문에, 지역과 주에는 실제 억양 신호가 담겨 있습니다. 따라서 이러한 필드는 요약되지 않고 그대로 공개됩니다. 이러한 유형의 분석은 인도 음성 인식(ASR)에 대해 대규모로 보고된 바 있습니다. 지역별 오류율은 대략 4%에서 44%까지 다양하며, 힌디어 사용 지역과 대도시에 비해 데이터 표현이 부족한 지역이 훨씬 뒤처지는 것으로 나타났습니다. 또한 음질, 말하기 속도, 발화 길이, 성별, 연령 및 기기별로 세분화된 분석 결과도 있습니다. 이러한 분석은 폐쇄형 벤치마크 데이터셋을 기반으로 수행되었습니다. Monsoon은 공개된 리더보드 테스트 데이터셋을 기반으로 동일한 수준의 분석을 가능하게 합니다.
수집 및 품질 관리
광범위한 지리적 범위를 포괄하려면 소수의 화자가 참여하는 장시간 세션보다는 수백 개의 지역에 걸쳐 모집해야 합니다. 이러한 규모의 분산 모집은 소규모 모집에서는 발생하지 않는 여러 가지 문제점을 야기합니다. 예를 들어, 참여자가 과제를 악용하거나, 재생된 오디오를 실시간 음성으로 제출하거나, 부주의한 주석을 다는 경우 등이 있습니다. 이러한 문제점들은 명확한 검증 절차를 통해 해결됩니다.
모집 및 녹음: 참여자들은 음성 코퍼스가 거의 포함되지 않는 농촌 및 준도시 지역까지 영향력을 미치는 글로벌 디지털 플랫폼인 Voice Arena 커뮤니티를 통해 모집되었습니다. 참여자들은 짝을 이루어 지정된 일상 주제에 대해 P2P 인터페이스(듀얼 채널)를 통해 2인 대화를 녹음했습니다. 참여자들은 각자 자신의 휴대폰과 인터넷 연결을 사용했습니다. 이들 중 상당수는 저사양 기기에 불안정한 대역폭을 사용했기 때문에, 공개된 오디오 파일에서도 이러한 불안정한 대역폭이 그대로 드러납니다. 참여 예정자들은 녹음 접근 권한을 부여받기 전에 언어 능력 심사를 완료했으며, 소정의 보상을 받고 교육 및 배포 목적 사용에 대한 사전 동의를 제공했습니다. 각 언어별 인구 규모와 화자 분포를 고려하여 화자별 녹음 시간 제한을 설정함으로써, 소수의 참여자가 특정 언어나 지역을 독점하는 것을 방지했습니다. 따라서 전체 참여자 중 절반 이상이 정확히 한 개의 녹음 세그먼트에만 참여했습니다.
참여 유도: 대규모로 자발적인 발언을 유도하는 것은 참여자들이 구조화된 안내 없이는 짧고 간결한 답변을 하는 경향이 있어 어려움이 있습니다. 따라서 각 대화에는 개방형 서술 단서가 제공되었고, 여행, 의료, 농업, 교육 및 디지털 서비스를 포함한 다양한 영역에 걸쳐 후속 질문이 점진적으로 제시되어 대화가 대본 없이 심층적인 설명으로 이어지도록 유도했습니다. 후보 주제는 대규모 언어 모델을 사용하여 생성한 후 원어민 언어 전문가가 검토하고 현지화했습니다.
품질 관리: 모든 녹음 파일은 전사 전에 일련의 검증 절차를 거쳤습니다. 발화 언어는 30개 이상의 언어에 대한 사람이 직접 주석을 단 데이터를 기반으로 학습된 언어 식별 모델을 사용하여 지정된 언어와 일치하는지 확인했습니다. 화자의 성별은 전용 분류기를 통해 본인이 보고한 내용과 대조하여 확인했으며, 이는 본인의 보고를 대체하는 것이 아니라 보완하는 용도로 사용되었습니다. 또한, 실제 자발적인 대화와 사전 녹음 또는 재생된 오디오를 구분하는 모델을 추가로 개발했습니다. 신호 대 잡음비 추정을 통해 알아듣기 어려울 정도로 음질이 저하된 녹음 파일을 제거했으며, 실제 환경의 음성적 사실성을 유지하기 위해 주변 소음은 의도적으로 보존했습니다. 이러한 검증을 통과한 녹음 파일은 음성 활동 감지를 통해 분할되었으며, 2초간의 연속적인 무음 구간 또는 15초 간격의 소프트 캡을 기준으로 분할하고, 다음 무음 구간에서 다시 무음 구간으로 분할했습니다. 분할은 채널별로 독립적으로 적용되었으므로 모든 세그먼트는 단일 화자, 단일 채널입니다. 분할된 세그먼트는 DNSMOS P.808 검사를 통과했습니다.
전사: 참조 전사본은 사람이 직접 작성했습니다. 초안은 해당 도메인 데이터로 학습된 내부 ASR 모델을 통해 생성되었으며, 이 모델들은 공개 순위표에 등재되어 있지 않으므로, 해당 데이터 세트로 평가된 시스템은 평가 기준이 되는 참조 전사본 생성에 기여하지 않았습니다. 이후 모든 단계는 원어민 언어 전문가가 엄격한 업무 분담을 기반으로 하는 5단계 프로토콜에 따라 수행했습니다. 각 수정 단계 후에는 다른 주석자가 독립적인 검증 단계를 수행하므로, 어떤 언어 전문가도 자신의 결과물을 검토하지 않습니다. 먼저 한 언어 전문가가 음성 신호에 맞춰 초안을 부분별로 수정하고, 다른 전문가가 이를 재검토하여 불일치 부분을 표시합니다. 이후 단계에서는 새로운 주석자가 이 과정을 반복하며 모호한 음성 표현, 코드 스위칭 경계, 개체명, 다양한 철자 변형에 걸친 표기법 일관성 등을 점진적으로 해결합니다. 숫자는 단어로 표기하여 전사본이 발화된 내용과 직접적으로 일치하도록 했습니다. 최종 단계에서도 여전히 불일치가 표시된 부분은 최종 제출 전에 재전사를 위해 반환되었습니다. 주석 작성자의 행동은 전체 과정에 걸쳐 자동으로 모니터링되었으며, 대상 스크립트 범위를 벗어난 문자, 부자연스러운 문자 또는 단어 반복, 비정상적으로 낮거나 높은 편집 횟수를 포함하는 제출물에 플래그가 지정되었습니다.
지역적 차이
다음은 공개된 인도 영어 분할 데이터를 사용하여 실행한 예시로, 메타데이터를 통해 어떤 종류의 평가가 가능한지 보여줍니다. 이는 데이터 세트가 제공하는 결과 자체에 대한 설명이 아니라, 모든 클립에 화자가 포함될 때 어떤 질문에 대한 답을 찾을 수 있는지를 보여주는 예시입니다.
리더보드에 있는 8개 모델은 이 데이터셋에서 4.81에서 4.99 WER 사이의 점수를 기록했습니다. 최고 점수와 최저 점수의 차이는 0.18점으로, 5시간 이내에 결정될 수 있는 결과입니다. 전체 코퍼스를 기준으로 순위를 매기면 이들은 모두 동일한 모델입니다.
화자를 지역별로 그룹화하면 다른 결과가 나타납니다. 각 화자의 출신 지역은 인도 내무부 산하의 주별 행정 구역인 지역 위원회로 통합되어, 표본 추출이 잘 된 5개의 지역으로 나뉩니다. openai/whisper-large-v3-turbo는 이 지역에서 0.46점 차이를 보입니다. 반면 mistralai/Voxtral-Mini-3B-2507 은 코퍼스에서 0.014점 차이로 뒤처지지만, 1.68점의 차이를 보이며 중부 지역에서는 4.38점, 동부 지역에서는 6.06점을 기록했습니다. 순위표에서는 거의 차이가 없는 두 시스템이 화자의 출신 지역에 따라 정확도가 얼마나 달라지는지는 거의 네 배나 차이가 납니다.
어느 지역이 가장 어려운지도 고정되어 있지 않습니다. ibm-granite/granite-speech-3.3-2b 는 북부 지역에서 가장 어렵고, microsoft/VibeVoice-ASR-HF는 남부 지역에서, mistralai/Voxtral-Mini-3B-2507 은 동부 지역에서 가장 어렵습니다. 만약 특정 지역만 전사하기가 더 어렵다면 모든 모델이 지역 순위를 똑같이 매길 것입니다. 하지만 그렇지 않다는 것은 오디오 자체보다는 모델에 문제가 있음을 시사합니다.
지역은 기록된 12가지 속성 중 하나이며, 위의 구역들은 428개 자치구를 대략적으로 집계한 것입니다. 연령, 교육 수준, 직업, 휴대전화 종류에 대해서도 동일한 방식으로 분류하며, 공개된 파일에는 이를 재현하는 데 필요한 모든 정보가 포함되어 있습니다. 하지만 발언 내용만 기록한 테스트 세트에서는 이러한 정보들을 전혀 이용할 수 없습니다.
힌디어의 철자 변형
영어의 표기법은 제한적입니다. 영국식 철자와 미국식 철자, 구두점, 대소문자, 숫자와 단어 등 대부분의 표기법은 표준화 도구를 통해 하나의 형태로 변환될 수 있으며, 리더보드에서도 이를 활용합니다. 하지만 힌디어는 이와 같은 방식으로 제한되지 않습니다. 일상 대화에서는 다양한 표기법이 혼용되고, 영어에서 유래한 단어들은 데바나가리 문자로 정해진 표기법이 없으며, 복합어는 사용자의 선호에 따라 붙여 쓰거나 따로 쓰기도 합니다. 하나의 구문에 10개 이상의 유효한 표기법이 존재할 수 있으며, 표준적인 표기법이 없기 때문에 이를 하나로 통합하는 고정된 변환 체계가 없습니다.
WER은 단일 참조를 기반으로 점수가 매겨지며, 주석 작성자가 선택한 철자를 정확하게 생성하는 시스템에 높은 점수를 부여합니다. 오디오를 동일하게 잘 인식한 두 시스템이라도 철자법 하나에서 몇 점의 차이를 보일 수 있습니다.
따라서 힌디어 데이터 세트는 격자 구조를 제공합니다. 즉, 전사본의 각 구간에 대해 올바르다고 인정되는 표기 형태 집합이 포함됩니다. 이 격자 구조 구축은 수작업입니다. 후보 변형은 동일한 오디오의 여러 ASR 전사본에서 추출되고 언어 모델로 확장됩니다. 그런 다음 원어민 언어학자가 해당 발화에 유효한 형태를 결정하고 나머지를 제거하여 발화 내용과 일치하는 형태만 남도록 합니다.
따라서 힌디어의 경우 WER (단어 오류율) 대신 AI4Bharat에서 도입한 OIWER(정자법 정보 기반 단어 오류율) 을 보고합니다 . 각 구간에서 가설이 허용된 집합과 정렬되므로 허용된 형태는 모두 올바른 것으로 간주되고 실제 인식 오류만 기록됩니다.
그 효과를 정량화하기 위해 동일한 가설에 대해 두 번 점수를 매겼습니다. 각 격자를 스팬별 첫 번째 변형으로 평탄화하면 기존 벤치마크에서 제공하는 것과 같은 단일 문자열 참조가 생성됩니다. 허용된 변형 중 어느 것을 선택하든 동일하게 잘 작동하며, 다른 것을 선택하면 다른 참조가 생성됩니다. 평탄화된 참조를 기준으로 점수를 매기면 모든 시스템의 오류율이 상승하며, 그 상승률은 균일하지 않습니다. 결과적으로 순위가 바뀝니다. 아래 그림은 두 참조 사이에서 순위가 반전된 두 쌍의 시스템을 보여줍니다. 단일 참조에서는 시스템이 주석 작성자의 철자를 재현한 것에 대해 부분적으로 보상을 받는 반면, 격자는 인식만 평가합니다.
또한 저희는 자체 구현체인 voi-oiwer를 오픈 소스로 공개하고 있으므로 이러한 데이터 세트에 대한 모든 결과를 직접 재현할 수 있습니다.
평가받기
비공개 분할 테스트를 진행하려면, 모델을 Open ASR Leaderboard에 등록해 주세요. Hugging Face 팀에서 평가를 진행합니다. 이전과 마찬가지로, 모델을 리더보드에 추가하는 과정은 Open ASR Leaderboard GitHub 에서 진행됩니다 .
- 풀 리퀘스트를 열면 모델 체크리스트가 나타납니다. 이전과 마찬가지로 공개 데이터셋에 대한 결과를 보고해야 합니다.
- 공개 데이터셋에서 결과를 검증하고 비공개 데이터셋에서 지표를 계산할 것입니다.
- 우리가 얻은 결과를 확인해 주세요.
인도 영어는 선택 사항이 아닌 기본 열 세트에 포함되어 메인 리더보드에 바로 표시되므로 모든 모델의 평균 WER(단어 오류율) 집계에 반영됩니다. 비공개 분할 데이터는 Appen 및 DataoceanAI 데이터와 함께 집계 열에 제공됩니다 . 공개 및 비공개 힌디어 데이터는 다국어 탭 에 표시되며 , 해당 탭에서는 선택한 모든 언어를 지원하는 모델만 순위가 매겨지므로 동일한 조건으로 비교할 수 있습니다. 또는 "언어 데이터 세트 구성" 드롭다운 메뉴에서 "힌디어"를 선택할 수도 있습니다.Voice Arena MonsoonPrivate (conversational)
다음은 무엇일까요?
힌디어는 일반적인 문제를 잘 보여주는 사례입니다. 두 가지 이상의 표기법을 가진 언어, 그리고 벤치마크에서 샘플링되지 않은 사람들이 사용하는 언어는 모두 여기서 설명하는 두 가지 문제점을 모두 안고 있습니다. 이러한 데이터 세트는 이러한 문제점을 해결하지는 못합니다. 하지만 문제점을 파악할 수 있는 방법을 제시합니다. 즉, 이미 많은 사람들이 주목하는 순위표에 테스트 데이터 세트를 추가하여 각 화자와 표기법에 대한 충분한 정보를 제공함으로써 두 시스템 간의 차이를 단순히 하나의 숫자로만 치부하는 것이 아니라, 누가 어떻게 말했는지, 어떤 표기법을 사용했는지까지 추적할 수 있도록 하는 것입니다.
이 네 가지 데이터 세트는 보이스 아레나가 글로벌 사우스 지역을 위해 추진하는 광범위한 데이터 세트 프로젝트인 몬순(Monsoon)의 일부입니다.
저희 블로그
