Technologia

Uklad Jalapeño OpenAI wykonuje inferencje z 1,9-krotnie wyzsza efektywnoscia niz Nvidia Blackwell na wat

Adrian Kessler

OpenAI zbudowało własny układ. Firma zaprezentowała Jalapeño na konferencji Hot Chips 25 sierpnia — projekt krzemu opracowany we współpracy z Broadcomem, który przetwarza zapytania inferencyjne z prędkością 85 448 tokenów na sekundę na kilowat. Architektura Blackwell Nvidii, obecny standard rynkowy, osiąga na tym samym wskaźniku 44 960. To przełożenie 1,9.

Ta metryka ma znaczenie, ponieważ inferencja to sposób, w jaki systemy AI działają w produkcji. Trenowanie odbywa się raz; inferencja ma miejsce za każdym razem, gdy ktoś wysyła zapytanie do ChatGPT, korzysta z API lub wchodzi w interakcję z jakąkolwiek aplikacją uruchamiającą model językowy. Koszt inferencji na dużą skalę jest głównym czynnikiem ekonomiki usług AI. Układ, który zmniejsza zużycie energii na inferencję mniej więcej o połowę, jeśli zostanie szeroko wdrożony, zmienia koszt pojedynczego zapytania w działaniu modeli.

W przypadku obciążeń interaktywnych, gdzie czynnikiem ograniczającym jest opóźnienie odpowiedzi, przewaga Jalapeño jest jeszcze większa. Raport SemiAnalysis z prezentacji na Hot Chips określił ten zakres na 2,1 do 4,1 razy lepiej niż Blackwell w tych testach porównawczych. Rozrzut odzwierciedla różnice między konkretnymi typami zadań; dolna granica to bardziej konserwatywne porównanie.

Układ obsługuje wyłącznie inferencję. Nie uruchamia obciążeń treningowych, które wytworzyły modele, do obsługi których zaprojektowano Jalapeño. Te nadal wymagają sprzętu Nvidii. Broadcom wyprodukował układ na podstawie umowy o niestandardowym projekcie z OpenAI, zamiast sprzedawać go jako produkt komercyjny. Taka konstrukcja daje OpenAI stworzoną na zamówienie warstwę inferencyjną bez konieczności konkurowania na otwartym rynku układów.

Harmonogram wdrożenia OpenAI jest ograniczony. Wdrożenie na małą skalę zaplanowano przed końcem 2026 r.; szersze wdrożenie to cel na 2027 r. Układ pozostaje w fazie próbek inżynieryjnych, co oznacza, że wersja produkcyjna nie została jeszcze dostarczona na dużą skalę. Wyniki z Hot Chips reprezentują docelowy projekt, a nie zweryfikowaną serię produkcyjną. Odstęp między ogłoszeniem na konferencji a operacyjnym wdrożeniem niestandardowego krzemu mierzy się zwykle w latach.

Ogłoszenie wpisuje się w szerszy trend wśród dużych firm AI w kierunku własnego krzemu. Google od dekady używa w produkcji własnych jednostek Tensor Processing Units. Amazon uruchamia Trainium i Inferentia w AWS. Meta wewnętrznie korzysta z własnych układów do inferencji. Wejście OpenAI potwierdza, że przy skali setek milionów aktywnych użytkowników ekonomia polegania wyłącznie na zewnętrznych dostawcach GPU staje się na tyle trudna, że uzasadnia koszt programu własnych, niestandardowych projektów.

Tagi: , , , , ,

Dyskusja

Jest 0 komentarzy.