Technologia

Gemini 3.8 Live zastępuje pustą twarz w obsłudze klienta przez AI

Adrian Kessler
Dodaj nas w Google

System to Gemini 3.8 Live z funkcją Live Avatar. Łączy on model Google’a do konwersji mowy na mowę z warstwą wideo generowaną w czasie rzeczywistym, która tworzy ruch ust i mimikę, a jednocześnie obsługuje wywołania narzędzi w tle — bez przerywania rozmowy. Język jest wykrywany automatycznie: awatar może w trakcie połączenia przechodzić między językami mówionymi, bez przekazywania rozmowy innemu systemowi, ponownego ładowania ani zauważalnej pauzy.

Tym, co odróżnia to rozwiązanie od technik nakładania obrazu wideo, jest generowanie dźwięku i obrazu w ramach tej samej ścieżki wnioskowania na żywo, zamiast w kolejnych etapach. Dzięki temu opóźnienie jest na tyle małe, by rozmowa mogła toczyć się w naturalnym rytmie. Google umieszcza niewidoczne dla użytkownika znaki wodne SynthID zarówno w dźwięku, jak i obrazie — każda sekunda zawiera znacznik możliwy do odczytania przez maszynę, który wskazuje, że materiał wygenerowała AI, nawet jeśli strumień zostanie później nagrany i odtworzony. Znak wodny przetrwa ponowne kodowanie, dzięki czemu pochodzenie wyeksportowanych klipów nadal można zweryfikować.

Najwyraźniej pokazuje to, jakie możliwości rozwiązanie otwiera przy wdrożeniach na dużą skalę, Equal AI, firma obsługująca wdrożenia korporacyjne w Indiach: jednocześnie działa tam dziewięć języków indyjskich, a system obsługuje ponad milion połączeń na żywo dziennie, przy łącznym wsparciu dla 97 języków. Zapewnienie takiej przepustowości przy porównywalnej dostępności i pokryciu zmian przez ludzkich konsultantów byłoby nieopłacalne. Założeniem przyjętym przy wdrożeniu nie jest sprawdzenie koncepcji — chodzi o przepustowość.

Google nie ujawnia natomiast ceny. Firma nie opublikowała cennika i odsyła zainteresowanych do swojego zespołu sprzedaży korporacyjnej. Tworzenie niestandardowych awatarów — czyli budowanie przez organizacje wizerunku na podstawie własnych obrazów referencyjnych — wymaga uzyskania dostępu w ramach osobnego procesu weryfikacji, a nie samodzielnej rejestracji. Funkcje Extended Thinking dla modelu Live są nadal dostępne w prywatnej wersji zapoznawczej, co ogranicza głębokość rozumowania w porównaniu z innymi rozwiązaniami Gemini od Google’a. Firma nie ujawniła limitów równoczesnych sesji. Ograniczony zakres premiery wpisuje się w stosowany przez Google’a model stopniowego udostępniania rozwiązań dla firm, w którym ceny i możliwości są ustalane indywidualnie, zamiast podawane publicznie.

Gemini 3.8 Live z funkcją Live Avatar jest już dostępny w konsoli Gemini Enterprise oraz przez Live API, z punktami końcowymi w Stanach Zjednoczonych i Unii Europejskiej. Google nie podał harmonogramu szerszego udostępnienia funkcji Extended Thinking dla modelu Live poza obecną grupą użytkowników prywatnej wersji zapoznawczej.

Firmy wdrażające to rozwiązanie odpowiedzą na pytanie, na które sama technologia nie daje odpowiedzi: czy usunięcie wizualnego sygnału wskazującego na automatyczną obsługę poprawia doświadczenie użytkowników, czy też odbiera im ostatnią uczciwą wskazówkę, że właśnie z taką obsługą mają do czynienia.

Tagi: , , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.