Chiński DeepSeek udostępnił 10 września 2026 r. model DeepSeek-V4.1-Flash: 552 mld parametrów w architekturze Mixture-of-Experts, kontekst do miliona tokenów, obsługę obrazów i wagi na licencji MIT. W tabeli wyników opublikowanej przez firmę model wyprzedza Claude Opus 5 i GPT-5.6 Sol w testach Terminal-Bench 2.1 i DeepSWE v1.1, a milion tokenów wyjściowych kosztuje poza godzinami szczytu 0,60 dol., o ok. 70 proc. mniej niż w dotychczasowym flagowcu DeepSeek-V4-Pro.
- DeepSeek udostępnił 10 września 2026 r. model DeepSeek-V4.1-Flash z 552 mld parametrów w architekturze Mixture-of-Experts, kontekstem do miliona tokenów, obsługą obrazów i wagami na licencji MIT.
- Deklarowana obniżka o 70 proc. dotyczy porównania V4.1-Flash z droższym modelem V4-Pro, a nie z poprzednim V4-Flash – wobec sierpniowego cennika Flasha tokeny wyjściowe potaniały jedynie o ok. 9 proc., a mimo to nadal kosztują ponad dwa razy więcej niż przed sierpniową podwyżką.
- DeepSeek wycofał się z zapowiedzi automatycznego przekierowania zapytań do deepseek-v4-pro na V4.1-Flash od 14 września 2026 r., uzasadniając decyzję jednym zdaniem: „w odpowiedzi na zapotrzebowanie użytkowników", a karta modelu pokazuje, że V4-Pro osiąga wyraźnie lepsze wyniki w teście przypominania faktów SimpleQA-Verified (55,2 wobec 42,3) i długiego kontekstu LongBench-V2 (51,5 wobec 45,2).
Liczba „70 proc.” trafiła do nagłówków, ale oznacza porównanie dwóch różnych modeli, a nie obniżkę ceny tego samego produktu. W porównaniu z poprzednim V4-Flash tokeny wyjściowe potaniały o ok. 9 proc. Model ciągle kosztuje też ponad dwa razy więcej niż V4-Flash przed sierpniową podwyżką. Rozbieram to niżej, bo dla firm płacących za API te różnice liczą się bardziej niż nagłówek.
DeepSeek V4.1-Flash ma 552 mld parametrów, ale na token aktywuje tylko 8-16 mld
DeepSeek-V4.1-Flash to najmniejszy model nowej rodziny architektur DeepSeeka, trenowany od zera, z rozumieniem obrazu wbudowanym od początku treningu. Poprzedni V4-Flash miał 284 mld parametrów i 13 mld aktywnych, więc nowy model jest prawie dwa razy większy, a przy przetwarzaniu promptu używa mniejszej części sieci.
Najważniejsze dane z karty modelu na Hugging Face i raportu technicznego:
- Architektura Causal Encoder-Decoder (CED): 40 warstw Transformera, 20 w enkoderze i 20 w dekoderze. Przy wczytywaniu promptu (prefill) aktywnych jest 8 mld parametrów, przy generowaniu odpowiedzi 16 mld.
- Eksperci: w każdej warstwie MoE jest 1 ekspert współdzielony i 384 ekspertów wybieranych, z czego model uruchamia 6 na token.
- Pamięć podręczna KV (KV cache): czyli bufor, w którym model przechowuje przetworzony kontekst, zajmuje 890 bajtów na token. To ok. 1/4 tego, co potrzebował V4-Flash, a zapis na dyskach SSD spadł do ok. 1/8.
- Trening: 45 bln tokenów danych tekstowych i obrazowych, kontekst rozszerzony do 1 mln tokenów.
- Sterowanie wysiłkiem rozumowania: parametr od 1 do 100, który pozwala wymienić koszt na dokładność.
DeepSeek tłumaczy, że opłaty za trafienia w pamięć podręczną stanowią dużą część kosztów pracy agentów AI, więc kompresja tej pamięci bezpośrednio obniża rachunek. To uzasadnienie nowego cennika: firma pisze, że przekazuje oszczędności klientom, „Przekazujemy te oszczędności wam” / „We’re passing the savings on to you.”
W API model działa pod nazwą deepseek-flash. Stare nazwy deepseek-v4-flash i deepseek-v4-flash-vision-exp są tymczasowo przekierowywane na V4.1-Flash, a same poprzednie modele wycofano.
Obniżka o 70 proc. dotyczy porównania z V4-Pro, a nie z poprzednim modelem Flash
Według oficjalnego cennika DeepSeeka V4.1-Flash poza godzinami szczytu kosztuje 0,15 dol. za milion tokenów wejściowych, 0,003 dol. za milion tokenów z pamięci podręcznej i 0,60 dol. za milion tokenów wyjściowych. W godzinach szczytu, czyli w dni robocze od 01:00 do 04:00 i od 06:00 do 10:00 UTC, stawki są dwa razy wyższe. Weekendy i chińskie święta państwowe w całości liczą się jako czas poza szczytem.
| Cena za 1 mln tokenów (poza szczytem) | V4-Flash przed 16.08.2026 | V4-Flash od 16.08.2026 | V4.1-Flash od 10.09.2026 | V4-Pro |
|---|---|---|---|---|
| Wejście (z pamięci podręcznej) | 0,0028 dol. | 0,007 dol. | 0,003 dol. | 0,022 dol. |
| Wejście (bez pamięci podręcznej) | 0,14 dol. | 0,22 dol. | 0,15 dol. | 0,66 dol. |
| Wyjście | 0,28 dol. | 0,66 dol. | 0,60 dol. | 1,98 dol. |
Tabela pokazuje dwie rzeczy. Wobec V4-Pro nowy model rzeczywiście jest o ok. 70 proc. tańszy na tokenach wyjściowych (0,60 wobec 1,98 dol.). Wobec V4-Flash z sierpniowego cennika spadek wynosi ok. 9 proc. na wyjściu, ok. 32 proc. na wejściu i ok. 57 proc. na pamięci podręcznej.
Kontekst jest tu niezbędny. DeepSeek ogłosił w sierpniu podwyżki cen dla V4-Flash i V4-Pro sięgające od 50 do ponad 1100 proc., zależnie od modelu, rodzaju tokenów i pory dnia, a nowe stawki weszły w życie 16 sierpnia o 16:00 UTC. Wcześniej od 23 maja 2026 r. obowiązywały stałe stawki, po tym jak DeepSeek utrwalił promocyjną obniżkę. Wrześniowa „obniżka” częściowo cofa więc sierpniową podwyżkę, ale tokeny wyjściowe nadal kosztują ponad dwa razy więcej niż przed nią.
W zestawieniu z konkurencją DeepSeek pozostaje jednak w innej lidze cenowej. Nawet przy stawce szczytowej 3,96 dol. za milion tokenów wyjściowych V4-Pro kosztuje wielokrotnie mniej niż GPT-5.6 Sol od OpenAI (30 dol.) i Fable 5 od Anthropic (50 dol.).
V4.1-Flash wygrywa krótkie zadania programistyczne, przegrywa długie i akademickie
W tabeli porównawczej na karcie modelu DeepSeek zestawia V4.1-Flash z Claude Opus 5, GPT-5.6 Sol i własnymi modelami. Wszystkie wyniki pochodzą od DeepSeeka, uzyskano je przy maksymalnym wysiłku rozumowania, a testy agentowe prowadzono głównie we własnym środowisku firmy, DeepSeek Harness.
| Test | Claude Opus 5 | GPT-5.6 Sol | DeepSeek V4-Pro | DeepSeek V4.1-Flash |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 89,1 | 88,8 | 87,9 | 90,6 |
| DeepSWE v1.1 | 74,0 | 73,0 | 62,7 | 74,2 |
| CyberGym | brak | 84,5 | 83,3 | 88,1 |
| GPQA Diamond | 93,4 | 94,1 | 92,4 | 90,9 |
| Humanity’s Last Exam (bez narzędzi) | 56,3 | 44,5 | 42,7* | 36,8 |
| Terminal-Bench 4.0 | 51,8 | 39,9 | 12,4 | 31,2 |
| ProgramBench | 37,0 | 23,0 | 15,5 | 20,3 |
*tylko podzbiór tekstowy testu
Obraz jest spójny. DeepSeek-V4.1-Flash wygrywa w zadaniach programistycznych o ograniczonej długości, a wyraźnie przegrywa z Claude Opus 5 w długich zadaniach agentowych (Terminal-Bench 4.0) i w najtrudniejszym egzaminie wiedzy Humanity’s Last Exam. Przewaga w DeepSWE v1.1 wynosi 0,2 pkt i zależy od środowiska testowego: według tej samej karty modelu w środowisku Claude Code V4.1-Flash rozwiązał 69,8 proc. zadań, a 74,2 proc. osiągnął w mini-SWE.
Niezależne pomiary dopiero się pojawiają. W Artificial Analysis Intelligence Index model w wariancie z maksymalnym rozumowaniem uzyskał 40 pkt, wyraźnie powyżej mediany 18 pkt dla modeli z otwartymi wagami podobnej wielkości, a przez API DeepSeeka generuje 214,4 tokena na sekundę.
Liczba „70 proc.” jest prawdziwa, ale uważam, że źle opisuje to, co się stało. DeepSeek w sierpniu podniósł ceny V4-Flash kilkukrotnie, a we wrześniu wypuścił nowy model, który jest tańszy od drogiego Pro i minimalnie tańszy od podrożałego Flasha. Dla kogoś, kto budował produkt na stawkach z wiosny, to nadal ponad dwukrotnie wyższy rachunek za tokeny wyjściowe.
Jednocześnie trudno nie docenić samego modelu. Wagi na licencji MIT, raport techniczny z konkretnymi liczbami i architektura, która czterokrotnie zmniejsza pamięć podręczną, to realny postęp, a nie tylko marketing. Wyniki z tabeli DeepSeeka traktuję jednak ostrożnie: przewaga 0,2 pkt nad Claude Opus 5, zmierzona we własnym środowisku firmy, nie jest dowodem wyższości.
Otwarte pytanie brzmi: czy era „absurdalnie taniego DeepSeeka” się skończyła? Sierpniowa podwyżka i taryfa zależna od pory dnia sugerują, że firma zaczęła liczyć koszty mocy obliczeniowej jak wszyscy inni.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
DeepSeek zapowiedział przekierowanie V4-Pro na V4.1-Flash i po jednym dniu się wycofał
W ogłoszeniu premiery DeepSeek napisał, że testy prowadzone przez wiele stron stawiają V4.1-Flash przed V4-Pro pod względem wydajności, kosztu, szybkości i łącznego czasu wykonania zadań. Firma zapowiedziała, że od 14 września 2026 r. o 04:00 UTC wszystkie zapytania do deepseek-v4-pro będą obsługiwane przez V4.1-Flash po stawkach Flasha, do czasu premiery V4.1-Pro.
Ten plan nie wszedł w życie. Poprawka z 11 września zastąpiła zapowiedź wymuszonej migracji informacją, że V4-Pro będzie działał po 14 września bez zmian w rozliczeniach. DeepSeek uzasadnił decyzję jednym zdaniem: „W odpowiedzi na zapotrzebowanie użytkowników” / „In response to user demand”.
Wycofanie się z decyzji mówi coś ciekawego o rynku. Część klientów wolała płacić więcej za V4-Pro, mimo że producent twierdzi, iż tańszy model jest lepszy. Dane z karty modelu częściowo to tłumaczą: V4-Pro w wersji bazowej ma wyraźnie wyższe wyniki w teście przypominania faktów SimpleQA-Verified (55,2 wobec 42,3) i w teście długiego kontekstu LongBench-V2 (51,5 wobec 45,2). Dla zespołów, które mają ustabilizowane procesy produkcyjne, nagła podmiana modelu pod tą samą nazwą to ryzyko, którego nie równoważy niższa cena.
DeepSeek działa przy tym w coraz bardziej napiętym otoczeniu. Jak podał SiliconANGLE, w dniu premiery Anthropic wymienił DeepSeeka w swoim raporcie o zagrożeniach wśród siedmiu chińskich laboratoriów, które miały prowadzić kampanie destylacji na modelach Claude, czyli trenować własne modele na odpowiedziach cudzego modelu. Anthropic przypisał DeepSeekowi ponad 12,1 mln wymian w ciągu 14 dni lipca. Według tego samego źródła DeepSeek w czerwcu miał pozyskać ponad 7,4 mld dol. przy wycenie powyżej 50 mld dol.
Otwarte wagi zmieniają rachunek dla polskich firm, które unikały API DeepSeeka
Polski kontekst DeepSeeka to przede wszystkim ochrona danych. Urząd Ochrony Danych Osobowych zwracał uwagę, że według polityki prywatności DeepSeek dane użytkowników mogą być przechowywane na serwerach w Chinach, i w związku z tym prezes UODO zalecał daleko idącą ostrożność w korzystaniu z usług chińskiego dostawcy. Ministerstwo Cyfryzacji nie zalecało urzędnikom korzystania z DeepSeek przy wykonywaniu obowiązków służbowych.
Te ostrzeżenia dotyczą aplikacji i usług, w których dane trafiają na serwery DeepSeeka, a więc także API. Licencja MIT dla V4.1-Flash pozwala firmie pobrać wagi, dostosować model i uruchomić go komercyjnie na własnej infrastrukturze albo u europejskiego dostawcy chmury, bez przesyłania danych do Chin. Karta modelu podaje gotowe instrukcje uruchomienia w popularnych narzędziach vLLM i SGLang, a na Hugging Face jest już 89 wersji skwantyzowanych, czyli odchudzonych kosztem precyzji.
Bariera jest sprzętowa, nie prawna. Nawet przy 8-16 mld aktywnych parametrów w pamięci trzeba utrzymać cały model o 552 mld parametrów. DeepSeek sam kieruje ofertę wsparcia do firm planujących wdrożenia na dużą skalę, z 2000 procesorami graficznymi i klastrem pamięci masowej. W mojej ocenie dla większości polskich firm realnym scenariuszem będzie więc korzystanie z modelu u zewnętrznego dostawcy hostującego go w UE, a nie własna serwerownia. To wciąż zmiana jakościowa w porównaniu z sytuacją, w której jedyną drogą było API na chińskich serwerach.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym oficjalnego komunikatu DeepSeek o premierze V4.1-Flash z dnia 10.09.2026, dziennika zmian API DeepSeek, cennika DeepSeek API oraz karty modelu DeepSeek-V4.1-Flash na Hugging Face z raportem technicznym. Kontekst rynkowy uzupełniono na podstawie SiliconANGLE i Quartz, a także danych Artificial Analysis, Tech Times i Popular AI. Stanowisko UODO: Prawo.pl.
Wyniki testów porównawczych pochodzą z materiałów DeepSeek i nie zostały niezależnie zweryfikowane przez redakcję. Obliczenia procentowych zmian cen wykonała redakcja AIPORT.pl na podstawie stawek z oficjalnego cennika i sierpniowych doniesień o podwyżce.
Cytaty z dokumentacji DeepSeek zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o modelach DeepSeek V4.1, w tym o premierze V4.1-Pro.
