일레븐랩스, 차세대 음성 모델 ‘일레븐 v4’ 출시…감정 표현 강화

5 days ago 2
[사진=일레븐랩스 제공] [사진=일레븐랩스 제공]

[아이티비즈 김문구 기자] 일레븐랩스가 텍스트 음성 변환(TTS) 모델인 ‘일레븐 v4(Eleven v4)’와 저지연 특화 모델 ‘일레븐 v4 터보(Eleven v4 Turbo)’를 출시했다고 1일 발표했다.

일레븐 v4는 기존 세대의 텍스트 음성 변환 모델이 텍스트를 단순히 소리 내어 읽는데 그쳤다면, 이를 한 편의 연기와 같은 수준으로 소화해 낸다. 텍스트에 담긴 어조와 말의 속도, 인물의 성격과 맥락을 해석해 긴박하고 극적인 분위기부터 다정하거나 익살스러운 느낌까지 감정이 살아 있는 음성을 구현한다.

특히 일레븐 v4는 이전 세대인 일레븐 v3 대비 일관성이 대폭 향상되었으며, 다자간의 역동적인 대화를 구현하는 능력이 크게 개선됐다. 

또한 이번에 선보인 ‘일레븐 v4 터보’는 빠르고 매끄러운 대화를 이어가면서도 뛰어난 표현력을 갖춘 에이전트를 구축할 수 있도록 지원한다. 첫 응답을 생성하는 데 걸리는 중간 추론 지연 시간이 평균 100밀리초(ms)에 불과해, 두 사람이 대화하는 평균 일시정지보다 더 빠르게 응답할 수 있으며, 실시간 상호작용 속에서도 일레븐 v4 특유의 풍부한 감정 표현력을 그대로 제공한다.

마티 스타니셰프스키 일레븐랩스 공동창립자 겸 최고경영자(CEO)는 "일레븐 v4는 그동안 AI에 결여되어 있던 풍부하고 표현력 넘치는 커뮤니케이션 능력을 제공한다"며 "폭넓은 감정 표현과 문맥 인지 능력을 바탕으로 전 세계 더 많은 시장에서 예술 창작과 에이전트 경험을 한 차원 높여줄 것"이라고 말했다.

 피오트르 다브코프스키 일레븐랩스 공동창립자 겸 최고기술책임자(CTO)는 "일레븐 v4는 더욱 폭넓은 감정 표현 범위와 세밀한 제어 기능을 제공하는 완전히 새로운 아키텍처를 기반으로 설계됐다"며, "개발 초기부터 저지연 활용 사례를 염두에 두고 설계한 만큼, 대화형 에이전트 분야에도 동일하게 뛰어난 표현력을 제공할 수 있게 됐다"고 전했다.

Read Entire Article