Modele Eleven v4 oraz Eleven v4 Turbo przynoszą istotny skok jakościowy w zakresie ekspresji, interpretacji kontekstu oraz stabilności generowanego głosu. Nowa architektura pozwala sztucznej inteligencji na płynne przełączanie emocji i operowanie ponad 90 językami.
Nowa architektura i precyzyjne sterowanie emocjami
Kluczową zmianą w Eleven v4 jest całkowicie przebudowana architektura systemu, która potrafi analizować tekst na wzór żywego aktora głosowego. Model nie generuje już wypowiedzi w sposób odizolowany, lecz bierze pod uwagę intencję, tempo, tożsamość postaci oraz dynamikę całej sceny. Dzięki temu dialogi wieloosobowe brzmią naturalnie, a rozmówcy reagują na wypowiedzi współrozmówców w czasie rzeczywistym.
Aktualizacja przyniosła również znaczne usprawnienie obsługi tzw. znaczników audio (audio tags). Użytkownicy mogą wstawiać bezpośrednio do skryptu instrukcje dotyczące zachowania głosu lub efektów dźwiękowych, takie jak szept, śmiech czy odgłosy otoczenia. Model v4 realizuje je znacznie precyzyjniej niż jego poprzednik, zachowując stabilność barwy głosu nawet przy wielokrotnym ponawianiu generowania tekstu.
Szybki kloning mowy i pełne wsparcie dla ponad 90 języków
Model v4 oraz jego niskopóźnieniowy wariant Eleven v4 Turbo umożliwiają klonowanie głosu na podstawie zaledwie 10-sekundowej próbki audio. Co istotne, stworzony profil głosowy zachowuje swoje unikalne cechy oraz brzmienie podczas generowania mowy w dowolnym z ponad 90 obsługiwanych języków, przyjmując naturalną dla danego obszaru akcentację.
Do łask powróciła również obsługa funkcji Professional Voice Clones (PVC), która nie była dostępna w wersji v3. Pozwala ona markom i twórcom na przeniesienie ich oficjalnego głosu do nowego modelu z zachowaniem pełnego zakresu emocjonalnego we wszystkich wspieranych językach.
Wariant Turbo stworzony z myślą o agentach głosowych
Równolegle z głównym modelem zadebiutował Eleven v4 Turbo, dedykowany zastosowaniom w czasie rzeczywistym oraz integracji z agentami AI. Wariant ten charakteryzuje się średnim opóźnieniem wnioskowania na poziomie około 100 ms oraz czasem do wygenerowania pierwszego dźwięku wynoszącym około 150 ms.
Dzięki optymalizacji dwukierunkowego strumieniowania (bidirectional streaming), wersja Turbo potrafi rozpoczynać generowanie mowy w trakcie tworzenia odpowiedzi przez model językowy LLM, zanim jeszcze całe zdanie zostanie ukończone. Rozwiązanie to ma znaleźć zastosowanie przede wszystkim w automatycznej obsłudze klienta, wirtualnych asystentach oraz systemach konwersacyjnych.
Dostępność i cennik nowego modelu
Oba zaprezentowane warianty – Eleven v4 oraz Eleven v4 Turbo – zostały udostępnione poprzez interfejs API, platformę ElevenLabs Studio, aplikację ElevenLabs Reader oraz w ramach systemu ElevenAgents. Zaawansowane modele są dostępne dla wszystkich użytkowników serwisu, w tym w ramach darmowego pakietu oferującego limit 10 000 kredytów miesięcznie.