Technologia

AMD kupuje Taalas, który zapisuje wagi AI w krzem i bije Nvidia 48-krotnie

Susan Hill

AMD przejmuje Taalas, startup z Toronto, który produkuje układy scalone z trwale wbudowanymi w krzem wagami modeli AI, zamiast ładować je z pamięci podczas inferencji. Jego układ HC1 generuje 16 960 tokenów na sekundę dla modelu Meta Llama 3.1 8B – według AMD jest to 48 razy szybciej niż procesory graficzne Nvidii i 8,5 razy szybciej niż Cerebras, specjalista od układów inferencyjnych.

Technologia stojąca za Taalas wykorzystuje strukturalną nieefektywność obecnego sposobu działania inferencji AI. Standardowe procesory graficzne są elastyczne: mogą uruchamiać dowolny model, przełączać się między zadaniami na żądanie i być przeprogramowywane, gdy model zostanie zaktualizowany. Ta elastyczność jest również wąskim gardłem. Ładowanie miliardów wag modeli z pamięci o dużej przepustowości do jednostek obliczeniowych przy każdym żądaniu inferencji powoduje opóźnienia, których nie da się wyeliminować przez dodanie większej liczby procesorów graficznych.

Taalas wbudowuje te wagi bezpośrednio w krzem układu w momencie produkcji. Model żyje w sprzęcie, a nie w pamięci, z której jest pobierany przy każdym żądaniu. Liczby przepustowości, które reklamuje AMD, odzwierciedlają ten wybór architektoniczny – ale za cenę, której firma nie bagatelizuje: gdy układ zostanie wyprodukowany z konkretnym modelem wbudowanym na stałe, jego aktualizacja wymaga nowego tape-outu krzemu. Taalas twierdzi, że do odświeżenia modelu wystarczy zmienić tylko dwie warstwy metalizacji, co skraca cykl, ale układy te nie mogą adaptować się w locie do nowszej wersji modelu.

Zgodnie z planem integracji AMD, układy Taalas będą obsługiwać generowanie tokenów – najbardziej czasochłonną fazę inferencji – podczas gdy procesory graficzne AMD Instinct będą zajmować się prefilowaniem i obliczeniami uwagi na początku każdego żądania. Połączony system działa na platformie Helios w skali racka. Dla operatorów chmurowych obsługujących stałe obciążenia modelami – boty obsługi klienta, potoki przetwarzania dokumentów, tłumaczenia w czasie rzeczywistym – obietnicą jest przepustowość na wat w szafie rack, której elastyczne klastry procesorów graficznych nie są w stanie dorównać przy porównywalnym koszcie.

To, czy ta kalkulacja przetrwa tempo odświeżania modeli w branży, jest kluczowym pytaniem. Główne laboratoria aktualnie aktualizują swoje modele produkcyjne mniej więcej co sześć miesięcy. Układ przypisany do Llama 3.1 8B dzisiaj może wymagać wycofania, gdy jego następca stanie się standardowym wdrożeniem. Twierdzenie Taalas o odświeżaniu dwóch warstw metalizacji pomaga, ale tape-out krzemu wciąż trwa miesiące – co stanowi znaczące opóźnienie, gdy modele zmieniają się szybciej niż cykle sprzętowe.

Przejęcie następuje siedem miesięcy po tym, jak Nvidia kupiła Groq – inne podejście do tego samego problemu szybkości inferencji – za podobno 20 miliardów dolarów. Procesory strumieniowe tensorów Groq również optymalizują pod kątem przepustowości, ale zachowują możliwość ładowania różnych modeli. AMD płaci nieujawnioną, ale prawdopodobnie niższą kwotę za startup, który postawił na odwrotny zakład.

Dla nabywców przejęcie Taalas należy do mapy drogowej, a nie katalogu. Układ HC2, przeznaczony dla modeli z maksymalnie 20 miliardami parametrów, jest wciąż w fazie rozwoju. Benchmark 48x dotyczy HC1 w określonych warunkach – rzeczywiste wdrożenia z mieszanym ruchem i zmiennymi rozmiarami wsadów dadzą inne wyniki. Zamknięcie transakcji spodziewane jest w czwartym kwartale 2026 roku, pod warunkiem uzyskania zgody regulacyjnej. HC1 został dostarczony w lutym w procesie 6 nm; data dostawy HC2 i docelowy węzeł produkcyjny pozostają niepotwierdzone.

Tagi: , , , ,

Dyskusja

Jest 0 komentarzy.