디지털 서비스에서 소외됐던 인도의 지역 언어를 폭넓게 알아듣는 오픈소스 음성인식 모델이 공개됐다. 인도과학원(IISc)과 ARTPARK가 개발한 스라바니(SraVaani) 1.0은 65개 인도 언어와 방언을 음성에서 문자로 바꾸는 데 초점을 맞췄다.
공식 모델 카드에 따르면 스라바니는 약 4억3000만 개 매개변수를 갖춘 자동 음성인식 모델이다. 연구진은 105개 언어가 담긴 3만1255시간 분량의 음성으로 사전 학습한 뒤, 여러 공개 데이터셋을 더해 65개 언어와 방언의 전사 음성 약 3만1270시간으로 미세 조정했다.

주요 언어 밖까지 넓힌 지원 범위
지원 목록에는 힌디어·벵골어·타밀어·텔루구어처럼 사용자가 많은 언어뿐 아니라 가로어, 곤디어, 니시어, 수미어, 완초어 등 데이터가 상대적으로 부족한 지역 언어와 방언도 포함됐다. 기존 음성 AI가 충분한 학습 자료를 확보한 언어에 집중해 온 것과 다른 접근이다.
음성 인터페이스가 행정·의료·교육 서비스로 확산될수록 지역 언어를 처리하지 못하는 기술은 또 다른 접근성 장벽이 될 수 있다. 스라바니는 완성도 높은 일부 언어만 고르는 대신 지원 범위를 먼저 넓혀 연구자와 개발자가 부족한 영역을 개선할 기반을 제공한다.

3만 시간대 데이터가 만든 기반, 정확도 편차는 과제
학습 기반이 된 바니(Vaani) 데이터는 다양한 지역의 자연스러운 발화를 모으는 데 초점을 맞췄다. 정해진 문장을 반복해서 읽는 방식보다 실제 억양과 지역별 표현을 담을 수 있어 저자원 언어 연구에 활용할 수 있는 폭을 넓혔다.
다만 지원 언어가 많다는 사실이 모든 언어에서 같은 정확도를 보장하지는 않는다. 공식 모델 카드도 언어별 미세 조정 데이터 양이 크게 달라 저자원 언어의 인식 정확도가 고자원 언어보다 낮을 수 있다고 밝혔다. 코드 전환이나 잡음이 많은 실제 환경에서도 추가 검증이 필요하다.
MIT 라이선스로 공개된 개발 기반
스라바니는 MIT 라이선스로 배포돼 연구와 서비스 개발에 활용할 수 있다. 모델 저장소에는 기본 체크포인트와 사용자 음성에 맞춰 추가 학습하는 코드, 예제 노트북도 함께 제공된다.
이번 공개의 의미는 하나의 모델이 인도의 언어 문제를 단번에 해결했다는 데 있지 않다. 그동안 상용 음성 AI의 지원 목록 밖에 머물렀던 언어를 실험하고 개선할 공통 출발점이 생겼다는 점이 핵심이다.