Technologia

DeepSeek V4.1 Flash: 552 mld parametrów, 8 mld aktywnych, cache tańszy o 60% — i remis z Opus 5

Adrian Kessler

DeepSeek V4.1 Flash działa w oparciu o nową architekturę, którą firma nazywa Causal Encoder-Decoder. Jej 552 miliardy parametrów rozłożone są na 20-warstwowy enkoder i 20-warstwowy dekoder, ale tylko 8 miliardów aktywuje się na tokenach wejściowych, a 16 miliardów na wyjściowych. To czyni ją strukturalnie oszczędniejszą od modeli, które do każdej operacji aktywują większe wycinki parametrów — wybór projektowy, który bezpośrednio przekłada się na koszt wnioskowania i efektywność pamięciową.

Zyski pamięciowe są konkretne. Cache KV V4.1 Flash wynosi 890 bajtów na token, czyli mniej więcej jedną czwartą tego, co w V4-Flash. Dzięki buforowaniu FP4 i Compressed Sparse Attention 2 trwały footprint cache’u spada do jednej ósmej poprzedniej generacji. Koszt przetworzonego już wejścia wynosi teraz 0,003 dolara za milion tokenów w godzinach poza szczytem — 60% mniej niż w V4-Flash. Wejście niebuforowane potaniało o 33%, wyjście o 11%.

W benchmarkach, które deweloperzy śledzą najczęściej, model radzi sobie bardzo dobrze. DeepSWE v1.1 — autonomiczny test inżynierii oprogramowania — daje mu wynik 74,2, minimalnie wyprzedzając Anthropic Opus 5 z 74,0 i GPT-5.6 Sol z 73,0. GPQA Diamond notuje 90,9. Wyróżniającą się luką jest Terminal-Bench 3.0: 30,0 wobec 43,3 Opusa 5 — realna różnica w zadaniach wymagających rozszerzonego interaktywnego debugowania.

Widzenie jest wbudowane od etapu pretreningu. Wcześniej V4 dzielił widzenie na osobny wariant Vision-Exp. V4.1 Flash zastępuje oba jednym modelem zbudowanym wokół DeepSeek-ViT — celowo trenowanego enkodera, opracowanego od początku wspólnie z modelem językowym. Wielomodalny poziom zniknął — każde wywołanie domyślnie otrzymuje widzenie.

Okno kontekstu wynosi 1 milion tokenów, a wyjście jest ograniczone do 384 000 — wystarczająco do analizy długich dokumentów i rozszerzonych przepływów agencyjnych bez dzielenia na fragmenty. Dotychczasowi użytkownicy API korzystający ze starych identyfikatorów deepseek-v4-flash i deepseek-v4-flash-vision-exp są już przekierowywani do V4.1 Flash. 14 września ruch DeepSeek V4 Pro również zostanie przełączony — po cenie Flasha.

DeepSeek określił V4.1 Flash jako „najmniejszy model w naszej rodzinie nowej architektury”. Większy V4.1 Pro na tej samej architekturze Causal Encoder-Decoder jest sugerowany. Jeśli utrzyma ścieżkę wydajnościową Flasha, przesunie wskaźnik wydajności na dolara tej architektury jeszcze wyżej na krzywej benchmarków — na terytorium, które obecnie zajmują modele kosztujące znacznie więcej za milion tokenów.

Architektoniczny punkt ma znaczenie wykraczające poza cennik. Wzrost cache’u KV jest podstawowym ograniczeniem przy uruchamianiu dużych modeli z długim kontekstem, a skaluje się on z każdym przetworzonym tokenem. Podejście V4.1 Flash — mniej aktywnych parametrów, skompresowany cache — rozwiązuje to ograniczenie bezpośrednio. To użyteczny szablon dla wdrożeń z długim kontekstem, a nie optymalizacja niszowa.

Tagi: , , , , ,

Dyskusja

Jest 0 komentarzy.