어도비가 생성형 AI 서비스 파이어플라이의 작업 범위를 이미지와 영상에서 오디오까지 넓혔다. 이용자는 한 작업 공간에서 배경 음악과 음성, 장면에 맞춘 효과음을 각각 만들 수 있다.
어도비의 20일(미국 현지시간) 공식 발표에 따르면 제너레이트 뮤직, 제너레이트 스피치, 제너레이트 사운드 이펙트가 파이어플라이의 정식 기능으로 제공된다. 영상 제작자가 여러 외부 도구를 오가지 않고 오디오 소재를 만들고 편집하도록 구성한 것이 핵심이다.

영상 길이와 분위기에 맞춘 음악 생성
제너레이트 뮤직은 스타일과 장르, 용도, 에너지 수준 같은 조건을 입력받아 영상에 사용할 원곡을 만든다. 영상 길이와 분위기에 맞춰 결과를 조정할 수 있어 배경 음악 탐색과 편집에 드는 시간을 줄이는 데 초점을 맞췄다.
제너레이트 스피치는 성격이 다른 음성 프로필을 선택하고 말하는 속도와 감정, 어조를 조절하도록 설계됐다. 어도비 자체 음성 모델과 함께 외부 음성 모델을 선택지로 제공해 제작 목적에 맞는 결과를 고를 수 있다.
장면 타이밍에 맞춘 효과음도 제작
제너레이트 사운드 이펙트는 장면의 타이밍과 에너지에 맞춘 폴리 음향을 생성한다. 멀티트랙 타임라인에서 파형을 맞추고 각 트랙의 볼륨을 조절하는 방식이라 기존 오디오 편집 흐름과 함께 사용할 수 있다.
어도비는 파이어플라이 모델을 라이선스를 받은 자료와 퍼블릭 도메인 콘텐츠로 학습시켰다고 설명하며 상업적 활용 가능성을 강조했다. 다만 실제 프로젝트에 적용할 때는 생성 결과가 제3자의 권리를 침해하지 않는지 이용자가 최종 확인할 필요가 있다.