인도 65개 언어 품은 음성 AI 스라바니…저자원 언어 장벽 낮춘다

디지털 서비스에서 소외됐던 인도의 지역 언어를 폭넓게 알아듣는 오픈소스 음성인식 모델이 공개됐다. 인도과학원(IISc)과 ARTPARK가 개발한 스라바니(SraVaani) 1.0은 65개 인도 언어와 방언을 음성에서 문자로 바꾸는 데 초점을 맞췄다.

공식 모델 카드에 따르면 스라바니는 약 4억3000만 개 매개변수를 갖춘 자동 음성인식 모델이다. 연구진은 105개 언어가 담긴 3만1255시간 분량의 음성으로 사전 학습한 뒤, 여러 공개 데이터셋을 더해 65개 언어와 방언의 전사 음성 약 3만1270시간으로 미세 조정했다.

인도 전역의 다양한 언어 음성을 인식하는 AI 개념 이미지
AI 생성 이미지

주요 언어 밖까지 넓힌 지원 범위

지원 목록에는 힌디어·벵골어·타밀어·텔루구어처럼 사용자가 많은 언어뿐 아니라 가로어, 곤디어, 니시어, 수미어, 완초어 등 데이터가 상대적으로 부족한 지역 언어와 방언도 포함됐다. 기존 음성 AI가 충분한 학습 자료를 확보한 언어에 집중해 온 것과 다른 접근이다.

음성 인터페이스가 행정·의료·교육 서비스로 확산될수록 지역 언어를 처리하지 못하는 기술은 또 다른 접근성 장벽이 될 수 있다. 스라바니는 완성도 높은 일부 언어만 고르는 대신 지원 범위를 먼저 넓혀 연구자와 개발자가 부족한 영역을 개선할 기반을 제공한다.

다양한 지역 음성 데이터로 음성인식 모델을 학습하는 개념 이미지
AI 생성 이미지

3만 시간대 데이터가 만든 기반, 정확도 편차는 과제

학습 기반이 된 바니(Vaani) 데이터는 다양한 지역의 자연스러운 발화를 모으는 데 초점을 맞췄다. 정해진 문장을 반복해서 읽는 방식보다 실제 억양과 지역별 표현을 담을 수 있어 저자원 언어 연구에 활용할 수 있는 폭을 넓혔다.

다만 지원 언어가 많다는 사실이 모든 언어에서 같은 정확도를 보장하지는 않는다. 공식 모델 카드도 언어별 미세 조정 데이터 양이 크게 달라 저자원 언어의 인식 정확도가 고자원 언어보다 낮을 수 있다고 밝혔다. 코드 전환이나 잡음이 많은 실제 환경에서도 추가 검증이 필요하다.

MIT 라이선스로 공개된 개발 기반

스라바니는 MIT 라이선스로 배포돼 연구와 서비스 개발에 활용할 수 있다. 모델 저장소에는 기본 체크포인트와 사용자 음성에 맞춰 추가 학습하는 코드, 예제 노트북도 함께 제공된다.

이번 공개의 의미는 하나의 모델이 인도의 언어 문제를 단번에 해결했다는 데 있지 않다. 그동안 상용 음성 AI의 지원 목록 밖에 머물렀던 언어를 실험하고 개선할 공통 출발점이 생겼다는 점이 핵심이다.

댓글 남기기

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.