Technologia

ElevenLabs v4 klonuje twój głos z 10 sekund nagrania i mówi nim w 90 językach

Susan Hill
Dodaj nas w Google

ElevenLabs udostępniło Eleven v4 — model zamiany tekstu na mowę, który potrafi przeczytać tekst na głos, śmiejąc się, wzdychając albo mówiąc z francuskim akcentem i ze złością, jeśli autor tak zażyczy. Błyskawiczne klonowanie głosu wymaga nagrania krótszego niż poczta głosowa, a sklonowany głos może potem mówić w dziesiątkach języków, zachowując własną barwę. Z narzędzia może skorzystać każdy, kto ma bezpłatne konto ElevenLabs.

Dla osób tworzących treści dźwiękowe oznacza to oszczędność nawet całych dni pracy. Podcaster może zdubbingować odcinek na japoński własnym głosem, niezależny twórca gry może nadać każdej drugoplanowej postaci odrębny sposób mówienia bez wynajmowania studia, a lektor audiobooków może wpisać pauzę albo chichot bezpośrednio do scenariusza. Druga strona tej możliwości jest równie konkretna: wiadomość głosowa, fragment rozmowy wideo czy kilka sekund nagrania opublikowanego w sieci wystarczą już, by stworzyć przekonującą kopię czyjegoś głosu.

Najważniejszą zmianą jest większa kontrola, a samo klonowanie wymaga zaledwie 10 sekund nagrania. Wcześniejsze modele ElevenLabs płynnie odczytywały tekst, ale nastrój musiały odgadywać. Wersja 4 przyjmuje wskazówki dla lektora wpisane w tekst w nawiasach kwadratowych, takie jak [laughs] lub [said angrily in French accent], a także polecenia dotyczące dźwięków tła, na przykład [light rain] czy [phone buzzing]. Firma twierdzi, że model odczytuje również ton i tempo z kontekstu, więc kwestia w napiętej scenie zabrzmi odpowiednio dramatycznie nawet bez dodatkowego oznaczenia. W scenach z kilkoma mówiącymi każda postać zachowuje ten sam głos przez dłuższe fragmenty — to słaby punkt syntetycznej narracji, w której głosy miały tendencję do zmieniania się w miarę czytania kolejnych rozdziałów.

Obsługa języków rozszerzyła się z 70 w poprzedniej wersji do ponad 90. Jak podaje TechCrunch, ElevenLabs wskazuje japoński, brazylijską odmianę portugalskiego, mandaryński i kantoński jako języki, w których jakość poprawiła się najbardziej. Sklonowany głos zachowuje swoją tożsamość przy zmianie języka: kopia głosu osoby mówiącej po hiszpańsku, czytająca tekst po niemiecku, nadal brzmi jak ta osoba, ale z naturalnym niemieckim akcentem. Drugi model, v4 Turbo, zaprojektowano z myślą o asystentach głosowych i pracownikach centrów obsługi telefonicznej. Zaczyna mówić po około 150 milisekundach — mniej więcej tyle trwa przerwa między wypowiedziami dwóch osób w rozmowie — i może odezwać się, zanim działający za nim chatbot skończy układać odpowiedź.

ElevenLabs nie jest jedyną firmą na tym rynku. Google, OpenAI, Cartesia, Deepgram i Fish Audio oferują syntetyczne głosy tym samym grupom twórców. Zaledwie kilka godzin po premierze niezależna firma analityczna Artificial Analysis umieściła v4 na pierwszym miejscu w swoim zestawieniu głosów, w którym słuchacze porównują anonimowe próbki. ElevenLabs twierdzi też, że w ślepych testach z konkurencyjnymi rozwiązaniami około trzech czwartych słuchaczy wolało v4 — to wynik pochodzący z własnych badań firmy.

Zastrzeżenia zaczynają się od wspomnianych 10 sekund. ElevenLabs deklaruje, że sklonowanie głosu wymaga zgody osoby, której nagranie jest przesyłane. Firma udostępnia publiczny klasyfikator, który może wykrywać dźwięk wygenerowany jej narzędziami, a klonowanie głosów niektórych polityków całkowicie blokuje. Te zabezpieczenia utrudniają przypadkowe nadużycia, ale opierają się na prawdomówności osoby przesyłającej nagranie. Oszust potrzebuje zaś tylko krótkiej próbki głosu krewnego, by upozorować fałszywy telefon alarmowy. Bezpłatny pakiet jest ponadto mocno ograniczony: według zestawienia planów przygotowanego przez Unite.AI pozwala wygenerować około 10 minut dźwięku miesięcznie, a płatne pakiety zaczynają się od 6 dolarów miesięcznie.

Eleven v4 i v4 Turbo zadebiutowały 28 września w aplikacji dla twórców ElevenLabs, na platformie agentów oraz w API dla programistów. Londyńska firma pozyskała w lutym 500 milionów dolarów od Sequoia przy wycenie wynoszącej 11 miliardów dolarów, a TechCrunch podaje, że jej przychody w ujęciu rocznym przekroczyły 600 milionów dolarów. Dyrektor generalny Mati Staniszewski powiedział TechCrunch, że firma planuje wejść na giełdę w najbliższych latach, nie wskazując konkretnego terminu.

Dla twórców głos, który na zawołanie śmieje się w 90 językach, oznacza studio nagraniowe w karcie przeglądarki. Dla wszystkich pozostałych to kolejny powód, by się rozłączyć i oddzwonić, jeśli znajomy głos w słuchawce prosi o pieniądze.

Tagi: , , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.