19 읽음
일레븐랩스 ‘Eleven v4 터보’, 첫 음성 150ms…체감 지연은 별개라는 지적
위키트리
ElevenLabs가 9월 28일(현지시각) 신규 음성 합성 모델 ‘Eleven v4’와 저지연 특화 버전 ‘Eleven v4 터보’를 공개했다. 회사는 v4를 자사 모델 중 가장 감정 표현이 풍부한 모델이라고 소개했고, 터보는 음성 에이전트와 실시간 대화용으로 설계됐다고 밝혔다. 두 모델은 ElevenAgents, ElevenCreative, ElevenAPI에서 즉시 이용 가능하며 무료 계정에서도 사용할 수 있다. 발표문은 표트르 돕코프스키(Piotr Dabkowski)와 마티 스타니셰프스키(Mati Staniszewski) 명의로 작성돼 회사 리서치 카테고리에 게시됐다.
Eleven v4는 완전히 새로운 아키텍처를 기반으로 한다. 회사에 따르면 텍스트에서 어조·속도·감정·캐릭터·맥락을 해석해 극적이거나 다정하거나 급박하거나 코믹한 말투까지 표현하면서도 화자의 정체성은 그대로 유지한다. 오디오 충실도도 이전 모델들보다 전반적으로 높아졌다고 회사는 설명했다.
새로운 화자 식별 방식은 에이전트 대화, 오디오북, 광고 등 여러 맥락에서 같은 목소리를 일관되게 유지하도록 설계됐다. 장면 단위 맥락(scene-level context) 기능은 화자가 바로 앞 대화 내용에 반응하도록 만들어, 따로 녹음한 문장을 이어붙인 것보다 자연스러운 대화를 만든다고 회사는 밝혔다.

Eleven v4에서는 사용자가 자연어로 연출을 지시하고 문장 안에 오디오 태그를 삽입할 수 있다. 회사가 제시한 예시로는 웃음소리, ‘프랑스 억양으로 화난 듯 말하기’, 잔잔한 빗소리, 휴대폰 진동음 등이 있고, 속삭임이나 문 닫히는 소리 같은 지시어도 대괄호 형태로 넣을 수 있다.
회사는 v4 모델이 이전 모델들보다 오디오 태그와 지시문을 더 정확히 따른다고 설명했다. 국제음성기호(IPA) 음소 지원도 크게 개선돼 커스텀 발음이 더 안정적으로 동작한다. 다만
실시간 응답을 위해 회사는 연구·엔지니어링 팀이 Eleven v4 터보를 ElevenAgents 대화형 플랫폼과 하나의 시스템으로 함께 최적화했다고 밝혔다. 터보는 양방향 스트리밍을 지원해 문장이 끝나기 전부터 오디오가 돌아오기 시작한다.
회사가 공개한 각주 방식 측정에 따르면, 터보는 2026년 9월 진행된 웹소켓 스트리밍 테스트에서 첫 음성이 나오기까지 걸리는 시간(median time to first speech)이 약 150ms로 나타났다. 비교 대상은 카르테시아 소닉 3.6, xAI TTS, 구글 제미나이 3.8 플래시라이트 TTS, 오픈AI GPT-4o 미니 TTS였고, 모든 시스템에서 네트워크 지연은 측정 후 제외했다. 제품 페이지 비교표에는 터보 150ms, 카르테시아 소닉 3.6 262ms, 오픈AI GPT-4o 미니 TTS 814ms가 나란히 표시됐다. 회사는 별도로 터보의 추론 지연시간(median inference latency)이 약 100ms라고 밝히며, 이는 두 사람이 대화할 때 평균적으로 생기는 침묵 구간보다 빠른 수준이라고 설명했다.
FourWeekMBA는 이 수치가 실제 사용자가 체감하는 지연과 다르다는 점을 짚었다. 100ms 추론 지연과 150ms 첫 음성 시간 모두 네트워크 구간을 제거하고 측정한 값이어서, 벤더 간 모델 성능을 비교하는 데는 적합하지만 실제 서비스에서 사용자가 느끼는 응답 속도를 그대로 보여주지는 않는다는 지적이다. 매체는 두 수치를 서로 빼거나 직접 비교하는 것도 실제 공개된 내용을 왜곡할 수 있다고 덧붙였다. 벤더마다 기본값이 다른 상태에서 ‘동일한 기본 설정’으로 비교했다는 점도 함께 감안해야 할 지점으로 짚었다.
ElevenLabs는 Eleven v4가 아티피셜 애널리시스의 프로바이더 보이스 아레나 리더보드에서 2026년 9월 기준 1위에 올랐다고 밝혔다. 블라인드 방식의 일대일 비교 테스트에서는 청취자의 약 75%가 v4를 선호했다고 회사는 전했다. 이 테스트는 카르테시아 소닉 3.6, 인월드 TTS-2, 구글 제미나이 3.8 플래시라이트 TTS, 구글 제미나이 3.8 플래시 TTS와 맞대결하는 방식으로 진행됐고, 표현력과 자연스러움을 기준으로 v4가 65~81%의 매치업에서 승리했다고 공개됐다. 다만 75% 선호도는 회사 자체 테스트로, 표본 크기나 신뢰구간은 발표문에 공개되지 않았다.
음성 복제 기능도 손질됐다. 순간 음성 복제는 10초 분량 음성만으로도 고음질 복제가 가능해졌고, 회사는 이 결과물이 기존 멀티링구얼 v2 모델의 프로페셔널 음성 복제보다 우수하다고 설명했다. v3에서 지원이 끊겼던 프로페셔널 음성 복제도 다시 지원되며 v4의 전체 감정 표현 범위를 그대로 활용할 수 있다. 복제 음성은 모두 소유자의 검증된 동의가 필요하고, 생성된 오디오는 AI 생성 여부를 식별하는 자사의 AI 스피치 클래시파이어 기술로 탐지할 수 있다고 회사는 밝혔다.
긴 분량 콘텐츠를 위한 리퀘스트 스티칭(생성 결과를 이어붙이는 방식)도 안정성이 크게 개선돼 ElevenLabs 스튜디오와 리더 앱에서 작업 경험이 나아졌다고 회사는 설명했다. 단일 생성은 최대 1만 자까지 지원하며, 컨텍스트 스티칭이 긴 대본 전체의 속도감과 전달력을 일관되게 유지해준다.
두 모델은 90개 이상 언어를 지원한다. 한 언어로 녹음한 목소리가 다른 언어를 구사할 때도 해당 언어 원어민의 억양을 자연스럽게 따라가며, 생성이 길어져도 원래 억양으로 되돌아가지 않는다고 회사는 설명했다. 요금은 기존 텍스트투스피치 모델과 같은 크레디트 구조를 따른다. 무료 요금제는 월 1만 크레디트로 약 10분 분량 오디오에 해당하고, 유료 요금제는 월 6달러부터 시작해 프로페셔널 음성 복제를 포함한다. 기업용 맞춤 요금제도 별도로 제공된다. 회사가 보유한 1만7500개 이상의 음성 라이브러리는 모두 v4와 호환되지만, 출시 이전에 만든 순간·프로페셔널 복제 음성은 새 모델에서 제대로 작동하려면 재학습이 필요하다.