Technologia

Głosowa AI OpenAI nie czeka już na twoją turę — kosztuje $0,05 za minutę

Susan Hill

Każde AI głosowe na rynku każe ci czekać, zanim zaczniesz mówić. GPT-Live-1 od OpenAI – nie. Model dostępny przez API OpenAI słucha i mówi jednocześnie – obsługując przerwania, pauzy i nakładanie się mowy tak, jak robi to człowiek podczas rozmowy.

Ceny to 0,05 USD za minutę za warstwę głosową – 1,50 USD za 30-minutową rozmowę, czyli 50 USD za 1000 minut rozmowy. Programiści płacą osobno za backend wnioskowania: własny GPT-6 Astra od OpenAI lub dowolny kompatybilny model obsługujący wywołania narzędzi i logikę biznesową. Warstwa głosowa zarządza mechaniką rozmowy; warstwa wnioskowania decyduje o tym, co AI faktycznie mówi i robi.

Co to rozdzielenie oznacza w praktyce: bot obsługi klienta może usłyszeć „chwila, właściwie chcę inną opcję” w środku zdania i odpowiedzieć na nią, zamiast brnąć przez przygotowaną odpowiedź. Korepetytor językowy może wychwycić, że uczeń potyka się o słowo, nie czekając, aż skończy. System rezerwacyjny może obsłużyć prawdziwą rozmowę telefoniczną, w której ludzie powtarzają się, zmieniają zdanie i mówią jeden przez drugiego.

W teście Full Duplex Bench – zaprojektowanym specjalnie do oceny jednoczesnej obsługi głosu w obu kierunkach – GPT-Live-1 uzyskuje wynik o 30 punktów procentowych wyższy niż jego poprzednik, GPT-Realtime-2.1. W połączeniu z GPT-6 Astra jako backendem wnioskowania przewyższa Tau3, benchmark obsługi klienta testujący złożone, wieloetapowe zapytania bez przerw w rozmowie.

Dwupoziomowa architektura to świadomy wybór projektowy. Czas mowy i wnioskowanie są rozliczane osobno, ponieważ skalują się inaczej: startup budujący lekką aplikację do nauki płaci mniej na obu warstwach niż przedsiębiorstwo prowadzące tysiące jednoczesnych rozmów obsługi klienta na GPT-6 Astra. Dolna granica to 0,05 USD za minutę za głos, niezależnie od tego, co działa w tle.

Czego GPT-Live-1 nie zmienia, to jakość odpowiedzi. Warstwa głosowa zajmuje się tym, kiedy i jak AI mówi – a nie tym, co wie. Dobrze wyczulona w czasie zła odpowiedź wciąż jest złą odpowiedzią. Programiści tworzący aplikacje obsługi klienta będą musieli ocenić obie warstwy osobno, a backend wnioskowania może dodać do rachunku więcej niż sama warstwa głosowa. OpenAI nie opublikowało również danych na temat wydajności architektury full-duplex w środowiskach o niskiej przepustowości lub na zaszumionych liniach telefonicznych, gdzie ciągłe wejście audio jest trudniejsze do utrzymania.

GPT-Live-1 jest już dostępny w API OpenAI. Firma nie ogłosiła produktu konsumenckiego opartego na tym modelu, choć zasugerowała, że przyszłe wersje trybu głosowego ChatGPT mogą korzystać z tej samej architektury podstawowej. Stawka 0,05 USD za minutę obowiązuje od momentu premiery; OpenAI nie opublikowało harmonogramu zmian cen ani listy modeli wnioskowania stron trzecich zatwierdzonych do użytku z warstwą głosową.

Tagi: , , , , ,

Dyskusja

Jest 0 komentarzy.