Chińska firma MiniMax udostępniła model H3, który z tekstu, zdjęć, nagrań wideo i dźwięku tworzy do 15 sekund filmu w rozdzielczości do 2K, razem ze zsynchronizowanym dźwiękiem stereo. W rankingu Artificial Analysis H3 zajął pierwsze miejsce w edycji wideo, a MiniMax opublikował jego wagi na Hugging Face, przy czym Unia Europejska, a więc także Polska, znalazła się w licencji na liście „terytoriów wyłączonych”.
- MiniMax H3 zajął pierwsze miejsce w edycji wideo w rankingu Artificial Analysis, wyprzedzając modele Google i ByteDance, choć w generowaniu wideo z tekstu i obrazu różnice między H3, Gemini Omni Flash i Seedance 2.0 mieściły się w granicy błędu.
- Publicznie udostępnione wagi H3 obejmują tylko moduł bazowy generujący obraz w rozdzielczości 768p – moduł H3-Context-IR, który według MiniMax ma kluczowe znaczenie dla jakości wyniku, oraz moduł H3-Regenerate-2K działają wyłącznie jako płatne usługi w chmurze.
- Licencja MiniMax H3 Community License wyklucza Unię Europejską, Stany Zjednoczone, Wielką Brytanię i Koreę Południową jako „terytoria wyłączone", co oznacza, że polskie firmy chcące uruchomić model na własnych serwerach muszą najpierw złożyć wniosek przez formularz licencyjny MiniMax.
Przykładowy klip 2K z oficjalnej karty modelu, wygenerowany z samego opisu tekstowego: https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/assets/t2va_2k.mp4
MiniMax wypuścił H3 31 lipca, a wagi udostępnił trzy dni później
MiniMax zaprezentował H3 w piątek 31 lipca 2026 r., najpierw w usługach hostowanych: platformie Hailuo AI i API. Według Reutersa firma zapowiedziała wtedy publikację wag „w ciągu kilku dni” i dotrzymała terminu: 3 sierpnia model trafił na Hugging Face, a ComfyUI (popularne narzędzie do budowania potoków generowania obrazu i wideo) dodało jego obsługę tego samego dnia.
H3 to trzecia generacja modeli wideo MiniMax, po Hailuo 01 i Hailuo 02, i pierwsza, której wagi firma udostępniła publicznie. Po premierze akcje MiniMax, notowanej w Hongkongu od stycznia 2026 r., wzrosły o 16 proc.
Najważniejsze parametry według karty modelu:
- długość klipu od 4 do 15 sekund, 24 klatki na sekundę,
- domyślnie 768 pikseli na krótszym boku, 2K po dodatkowym przebiegu modułu H3-Regenerate-2K,
- dźwięk 32 kHz stereo generowany w tym samym przebiegu co obraz, bez osobnego modelu audio,
- stabilna obsługa dialogów w 11 językach (bez polskiego, pozostałe języki działają „w różnym stopniu”),
- proporcje obrazu m.in. 21:9, 16:9, 1:1 i 9:16,
- tryb referencji: do 9 obrazów, 3 klipów wideo i 3 nagrań audio, łącznie maksymalnie 12 plików.
Jeden transformer zamiast zestawu osobnych modeli
MiniMax opisuje H3 jako „omnimodalny” system, który rozumie jednocześnie tekst, obraz, wideo i dźwięk, a nie sklejkę z osobnych modeli do tekstu na wideo, obrazu na wideo i syntezy mowy. Rdzeniem jest H3-Omni-Transformer, gęsty model o 33 mld parametrów, z czego około 13 mld przypada na gałęzie AdaLN, które przy samym wnioskowaniu można wyliczyć z góry i nie ładować do pamięci. Jako koder tekstu i obrazu H3 wykorzystuje pełne wagi Qwen3-VL-32B od Alibaby.
W praktyce jedno polecenie może połączyć kilka źródeł: zacząć od zdjęcia, przejąć ruch kamery z dwóch filmów, podkład muzyczny z trzeciego nagrania i dopisać dialog. H3 potrafi też edytować istniejące wideo i przenosić ruch z jednego nagrania na drugie.
Według DeepLearning.AI MiniMax twierdzi, że trenował H3 na „prawdziwych, naturalnych danych”, a nie na danych syntetycznych, i że wszystkie rodzaje dźwięku (mowa, muzyka, efekty) po raz pierwszy modelował jednym koderem.
H3 prowadzi w edycji wideo, w generowaniu walczy z Google i ByteDance
Serwis Artificial Analysis, który porównuje modele na podstawie ślepych ocen użytkowników, umieścił H3 na pierwszym miejscu w edycji wideo. W generowaniu wideo z tekstu i z obrazu H3 ustępował na starcie Gemini Omni Flash od Google, a w trybie obraz na wideo także Seedance 2.0 od ByteDance. The Batch zaznacza, że różnice mieściły się w granicy błędu, więc H3 należy traktować jako jeden z trzech modeli z czołówki.
Rynek, na który wchodzi H3, jest w Chinach wyjątkowo gęsty. ByteDance rozwija serię Seedance (w chwili premiery H3 wchodziła wersja 2.5), a Kuaishou model Kling 3.0. MiniMax przekonuje, że wygenerowanie wideo 2K kosztuje w jego API mniej niż jedną trzecią ceny głównych konkurentów. Cennik API wynosi 0,13 dolara za sekundę wideo 2K i 0,08 dolara za sekundę w 768p.
„Otwarte wagi” obejmują tylko jeden z trzech modułów
Pełny system H3 składa się z trzech części, a do pobrania jest tylko środkowa:
- H3-Context-IR analizuje polecenie i materiały wejściowe, a następnie zamienia je w szczegółowy opis dla modelu bazowego. Moduł działa wyłącznie jako usługa w chmurze MiniMax.
- H3-Base generuje obraz i dźwięk w 768p. To jedyna część z publicznymi wagami, w dwóch wariantach: FL2VA (tekst oraz pierwsza i ostatnia klatka) i Ref2VA (tryb referencji).
- H3-Regenerate-2K generuje wynik ponownie w 2K, z pełnym kontekstem wejściowym. MiniMax zapowiada publikację, „gdy moduł będzie gotowy”.
Sam MiniMax pisze na karcie modelu, że H3-Context-IR „ma kluczowe znaczenie dla jakości końcowego wyniku” / „is critical to the quality of the final output”. Kto uruchomi H3 lokalnie, dostanie więc 768p i musi sam pisać bardzo dokładne polecenia albo zbudować własny preprocesor według instrukcji MiniMax. Jakość z materiałów promocyjnych wymaga płatnego API.
Wymagania sprzętowe zależą od konfiguracji. Przepis vLLM podaje, że 8,7 sekundy wideo 1248×768 z dźwiękiem powstaje w około 87 sekund na czterech kartach Nvidia B300. Zespół ComfyUI twierdzi, że w jego zoptymalizowanej wersji H3 uruchomi się nawet na karcie RTX 3060, ale nie podaje czasu generowania.
Widzę w H3 dwie rzeczy naraz. Pierwsza jest naprawdę dobra: model z samej czołówki, którego wagi można pobrać, dostrajać i badać, a społeczność zrobiła to błyskawicznie, bo na Hugging Face ma już ponad sto adapterów i kilkaset pochodnych modeli. Druga budzi mój sceptycyzm. Słowo „otwarty” jest tu mocno naciągnięte, skoro moduł decydujący o jakości i moduł 2K zostają w chmurze MiniMax, a Europa, Stany Zjednoczone, Wielka Brytania i Korea Południowa muszą składać wnioski. Uważam, że to bardziej sprytny model sprzedażowy niż otwarte oprogramowanie: dajesz za darmo silnik, a zarabiasz na tym, co sprawia, że silnik dobrze jedzie. Nie potępiam tego, ale czytelnik powinien wiedzieć, co dokładnie dostaje. Otwartym pytaniem zostaje, czy wyłączanie całych regionów z licencji stanie się standardem chińskich laboratoriów i jak zareagują na to europejscy regulatorzy.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Licencja H3 wyklucza Unię Europejską, USA, Wielką Brytanię i Koreę Południową
Licencja MiniMax H3 Community License pozwala na użycie niekomercyjne i komercyjne, ale nazywa Stany Zjednoczone, Wielką Brytanię, Unię Europejską i Koreę Południową „terytoriami wyłączonymi”. Użytkownicy z tych regionów muszą złożyć w MiniMax wniosek przez formularz, aby korzystać z wag na tych samych warunkach co reszta świata.
Licencja ma też inne zastrzeżenia. Firmy używające H3 komercyjnie muszą w widocznym miejscu podawać nazwę modelu, a wszystkim użytkownikom zakazano trenowania innych modeli na wynikach H3 (tzw. destylacji). Zabronione jest także użycie szkodzące nieletnim, ingerujące w wybory lub łamiące lokalne prawo.
Redakcja The Batch, newslettera DeepLearning.AI, oceniła, że ograniczanie użycia wag według krajów „nie ma sensu” poza przypadkami łamania lokalnego prawa: „ograniczanie użycia wag według kraju nie ma żadnego sensu” / „it makes no sense to restrict use of weights by country”.
Co H3 oznacza dla polskich twórców i firm
Polska jako członek UE podlega wyłączeniu terytorialnemu, więc polskie studia, agencje reklamowe czy sklepy internetowe, które chcą uruchomić H3 na własnych serwerach, powinny najpierw złożyć wniosek przez formularz licencyjny MiniMax. Sama możliwość pobrania pliku z Hugging Face nie oznacza, że użycie w Polsce jest objęte standardowymi warunkami.
Drugie ograniczenie dotyczy języka. Polski nie znalazł się wśród 11 języków, w których MiniMax deklaruje stabilne generowanie dialogów, więc klipy z polską mową wymagają testów przed użyciem w kampanii. MiniMax wskazuje reklamę, e-commerce, projektowanie produktów i gry jako główne zastosowania H3, a to akurat obszary, w których polskie firmy intensywnie testują generatywne wideo. Na razie nie znalazłem publicznych informacji o polskich wdrożeniach H3.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym karty modelu MiniMax H3 na Hugging Face opublikowanej 03.08.2026, analizy The Batch (DeepLearning.AI) z 14.08.2026 oraz depeszy Reutersa w przedruku The Standard z 31.07.2026. Dane wykorzystane do weryfikacji pochodzą także z bloga ComfyUI, przepisu vLLM oraz serwisu eWeek (wyniki Artificial Analysis).
Cytaty z karty modelu MiniMax i z The Batch zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o modelu MiniMax H3, w tym o publikacji modułu H3-Regenerate-2K i zasadach licencjonowania w Unii Europejskiej.
