Pathway, startup AI założony przez Polaków Zuzannę Stamirowską, Adriana Kosowskiego i Jana Chorowskiego, opisał model BDH-CQ, który rozwiązuje zagadki logiczne bez generowania pośrednich kroków rozumowania w formie tekstu. Model o 150 mln parametrów rozwiązał 29,5 proc. zadań z publicznego zestawu ARC-AGI-1 przy koszcie około 0,0007 dol. za zadanie, według autorów około 11 razy taniej niż GPT-5.6 Luna.
- Model BDH-CQ polskiego startupu Pathway rozwiązuje zagadki logiczne bez generowania pośrednich kroków rozumowania w formie tekstu – zamiast tego przetwarza problem wielokrotnie w wewnętrznej przestrzeni ukrytej i dekoduje gotową odpowiedź.
- Model o 150 mln parametrów rozwiązał 29,5 proc. zadań z publicznego zestawu ARC-AGI-1 przy koszcie około 0,0007 dol. za zadanie, co autorzy szacują jako około 11 razy taniej niż GPT-5.6 Luna – przy czym GPT-5.6 Luna osiąga wyższy wynik, a oba koszty były liczone odmienną metodą.
- Pathway pozyskał łącznie 30 mln dolarów w rundzie seed przy wycenie 500 mln dolarów, a zebrane środki mają trafić głównie na moc obliczeniową i skalowanie architektury BDH.
Wyniki opisuje preprint „BDH-CQ: In-Context Learning with Recurrent Latent Reasoning”, opublikowany 10 sierpnia 2026 r. w serwisie arXiv. Praca nie przeszła recenzji naukowej. Szerzej o badaniu napisał 22 września amerykański magazyn Science News, a za nim polskie media.
BDH-CQ rozwiązuje problem w pamięci modelu, a nie w wygenerowanym tekście
Większość dzisiejszych modeli rozumujących korzysta z techniki chain-of-thought (łańcuch myśli): przed udzieleniem odpowiedzi generuje długi ciąg tokenów, czyli fragmentów tekstu, w których rozpisuje kolejne kroki. Każdy token kosztuje moc obliczeniową, więc dłuższe rozumowanie oznacza wolniejsze i droższe odpowiedzi. Autorzy pracy zwracają uwagę, że wraz z wydłużaniem się takich „śladów rozumowania” rosło zużycie tokenów, opóźnienia i koszt obliczeń.
BDH-CQ działa inaczej. Przykłady pokazane modelowi przy rozwiązywaniu zadania aktualizują jego pamięć rekurencyjną o stałym rozmiarze, która nie rośnie wraz z liczbą przykładów. Model nie musi więc za każdym razem ponownie przeglądać wszystkiego, co już zobaczył. Samo zadanie rozwiązuje przez wielokrotne przekształcanie stanu wewnętrznego w wielowymiarowej przestrzeni ukrytej (latent space) i dekoduje dopiero gotową odpowiedź.
„Gdy pojawia się zapytanie, model w ogóle nie rozpisuje swojego myślenia w słowach” / „Once the query arrives, the model doesn’t write out its thinking in words at all”, powiedziała Science News Zuzanna Stamirowska, badaczka systemów złożonych i prezeska Pathway. W rozmowie z serwisem XYZ porównała działanie modelu do gracza, który myśli w przestrzeni abstrakcyjnej, „bardziej jak szachista, który analizuje kilka możliwości naraz”.
BDH-CQ opiera się na architekturze Dragon Hatchling (BDH), którą Pathway przedstawił we wrześniu 2025 r. jako alternatywę dla transformerów, czyli architektury stojącej za ChatGPT, Claude czy Gemini. Nazwa pochodzi od „smoczego pisklęcia”.
Model rozwiązał 118 z 400 zadań ARC-AGI-1 przy dwóch próbach
ARC-AGI-1 to zestaw zagadek wizualnych na kolorowych siatkach, stworzony przez François Cholleta do mierzenia, jak sprawnie system uczy się nowych umiejętności. Model dostaje kilka przykładów przekształcenia (np. obrót figury czy zaznaczenie wspólnych pól dwóch paneli), musi sam wywnioskować regułę i zastosować ją do nowej siatki. Odpowiedź jest albo dokładnie poprawna, albo błędna.
Według preprintu wyniki BDH-CQ na 400 publicznych zadaniach ewaluacyjnych wyglądają tak:
- 29,5 proc. (118 zadań) przy dwóch próbach (pass@2), zgodnie z konwencją rankingu ARC Prize,
- 24,25 proc. (97 zadań) przy jednej próbie (pass@1),
- około 0,85 sekundy pracy GPU Nvidia H200 na zadanie, co przy stawce 3 dol. za godzinę H200 daje 0,00070 dol. na zadanie,
- 59,4 proc. rozwiązanych zadań w pokrewnym teście ConceptARC.
Autorzy piszą, że model nie był trenowany na zadaniach ewaluacyjnych ani nie aktualizuje swoich parametrów w trakcie rozwiązywania. Wynik 29,5 proc. odtworzyli w audycie typu black-box Remigiusz Kinas z Bielik AI i Richard Zhong z New York University. Obaj są jednak współautorami pracy, więc trudno mówić o w pełni zewnętrznej weryfikacji.
Porównanie z GPT-5.6 Luna jest efektowne, ale obarczone zastrzeżeniami
Hasło „11 razy taniej niż GPT-5.6 Luna” wymaga doczytania. Autorzy liczą koszt BDH-CQ z czasu pracy sprzętu, a koszty innych systemów biorą z rankingu ARC Prize, gdzie bywają cenami API albo szacunkami sprzętowymi. Sami przyznają, że oba koszty wyliczono odmiennie.
| System | Wynik ARC-AGI-1 (pass@2) | Koszt na zadanie | Relacja kosztu do BDH-CQ |
|---|---|---|---|
| BDH-CQ (150 mln parametrów) | 29,5% | 0,00070 dol. | punkt odniesienia |
| GPT-5.6 Luna (Low), dane ARC Prize z lipca 2026 | 34,2% | 0,040 dol. | ok. 57 razy drożej |
| GPT-5.6 Luna (Low), po obniżce cen API OpenAI z 30.07.2026 | brak nowego pomiaru w pracy | wyliczenie autorów | ok. 11 razy drożej |
GPT-5.6 Luna nadal osiąga więc wyższy wynik. Serwis XenoSpectrum, powołując się na ponowny pomiar ARC Prize po obniżce cen, podaje dla GPT-5.6 Luna (Low) 39,5 proc. przy 0,008 dol. za zadanie. Przewaga kosztowa BDH-CQ zostaje wtedy na poziomie około 11 razy, ale różnica w skuteczności rośnie z 4,7 do 10 punktów procentowych.
Trzeba też pamiętać o skali. BDH-CQ to wyspecjalizowany model zbudowany pod zadania typu ARC, a GPT-5.6 Luna jest modelem ogólnego przeznaczenia. Jonas Geiping z ELLIS Institute Tübingen i Instytutu Maxa Plancka ds. Systemów Inteligentnych zauważył w rozmowie z Science News, że utrudnia to bezpośrednie porównanie, choć samo podejście ocenił pozytywnie i docenił, że model radzi sobie z nowymi zadaniami bez ponownego trenowania. Yuntian Deng z University of Waterloo nazwał wynik interesującym pod względem wydajności, ale zaznaczył, że nie dowodzi on przewagi samej architektury, bo potrzebne są testy oddzielające wpływ konstrukcji modelu od sposobu treningu.
Czytając preprint Pathway, widzę dwie rzeczy naraz. Pierwsza to rzadko spotykana uczciwość: autorzy sami rozbierają swój model na części, pokazują, gdzie się sypie, i przyznają, że porównanie kosztów z OpenAI nie jest liczone jednakowo. Druga to marketing, który z tej ostrożności robi nagłówek „11 razy taniej”. Oba obrazy są prawdziwe.
Dla mnie ciekawsze od ceny jest pytanie o przejrzystość. Łańcuch myśli, nawet jeśli nie zawsze oddaje rzeczywisty tok obliczeń modelu, jest dziś jednym z niewielu okien, przez które da się zajrzeć do środka. Model, który rozumuje „po cichu”, zamyka to okno. W zagadkach na kolorowych siatkach to nie problem, bo odpowiedź da się sprawdzić co do piksela. Ale jeśli taka architektura trafi do finansów czy medycyny, a Pathway wprost o tych branżach mówi, ktoś będzie musiał odpowiedzieć na pytanie, jak audytować decyzję, której nikt nie widział. Nie uważam, że to dyskwalifikuje pomysł. Uważam, że to pytanie powinno paść, zanim ktoś zacznie mówić o wdrożeniach.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
BDH-CQ dobrze kopiuje i przesuwa, gorzej porządkuje i łączy reguły
Autorzy przeprowadzili serię kontrolowanych testów na nowo wygenerowanych zadaniach, żeby sprawdzić, czego model faktycznie uczy się z przykładów. Wyniki są bardzo nierówne.
Model radzi sobie świetnie z prostymi operacjami: przedłużaniem figury do krawędzi siatki (48 na 48 poprawnych odpowiedzi), kopiowaniem motywu w kilka miejsc (48 na 48) i podmianą kolorów według reguły pokazanej w przykładach (96 na 96). Obrót motywu połączony z jego przeniesieniem w inne miejsce rozwiązał we wszystkich 72 przypadkach.
Problemy zaczynają się przy dłuższych sekwencjach i złożeniach reguł. Przy sortowaniu ośmiu słupków według wysokości model trafił tylko raz na 24 próby. Odbicie lustrzane połączone z przeniesieniem motywu udało się w 47 na 72 przypadkach, a zamiany dwóch kolorów w połączeniu z przeniesieniem model nie opanował wcale (0 na 72). W teście ConceptARC najsłabiej wypadły kategorie „kopiowanie” i „porządkowanie”, po 2 na 10 zadań.
Autorzy wskazują też sposób na część tych słabości. Gdy wśród przykładów pojawiało się zadanie o podobnym poziomie trudności co testowe, wyniki wyraźnie rosły: w zadaniach z pięciokrotnym zagnieżdżeniem z 19 do 24 na 24, a przy sortowaniu ośmiu elementów z 0 do 13 na 24. Model lepiej więc stosuje regułę, którą widział w danej skali, niż samodzielnie ją ekstrapoluje.
Pathway nie ujawnia wszystkich szczegółów. W preprincie zaznaczono, że wymiary modelu, dokładne reguły aktualizacji pamięci i pełna receptura treningu pozostają zastrzeżone.
Pathway to startup Polaków wyceniony na 500 mln dolarów
Pathway ma siedzibę w Palo Alto w Kalifornii, ale założyli go i kierują nim Polacy: Zuzanna Stamirowska, Adrian Kosowski i Jan Chorowski. Publikacja BDH-CQ zbiegła się w sierpniu 2026 r. z ogłoszeniem kolejnej transzy finansowania zalążkowego, która podniosła łączną kwotę pozyskaną w rundzie seed do 30 mln dolarów przy wycenie 500 mln dolarów. Według serwisu Vestbee pieniądze mają trafić głównie na moc obliczeniową, w tym systemy Nvidia GB300, oraz na skalowanie architektury BDH.
Polski ślad jest też w samej publikacji. Wśród współautorów jest Przemysław Uznański, a niezależny audyt wyniku przeprowadził Remigiusz Kinas, współtwórca rodziny polskich modeli językowych Bielik. Pathway przekonuje, że wstępne eksperymenty z modelami BDH od 1 mld do 600 mld parametrów wskazują na prawa skalowania podobne jak u transformerów. Stamirowska mówiła jednak serwisowi XYZ, że model 600 mld parametrów służył tylko do sprawdzenia zachowania architektury i nie był dalej trenowany na dużej ilości danych.
Dla polskiego rynku Pathway jest przede wszystkim sygnałem, że polscy badacze mogą konkurować z największymi laboratoriami AI nie skalą, a pomysłem na architekturę. Firma zapowiada, że najpierw chce wprowadzać BDH do konkretnych, kosztownych procesów w firmach, zamiast od razu zastępować modele transformerowe. Kolejnym celem badawczym ma być trudniejszy test ARC-AGI-2 oraz rozszerzenie podejścia na język i matematykę.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym preprintu BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888) opublikowanego 10.08.2026 przez zespół Pathway, artykułu Science News z 22.09.2026 oraz materiałów Rzeczpospolitej, Vestbee i XenoSpectrum. Polski kontekst na podstawie rozmowy z Zuzanną Stamirowską opublikowanej przez XYZ.
Cytat Zuzanny Stamirowskiej, prezeski Pathway, został zweryfikowany z oryginalnym anglojęzycznym materiałem Science News. Wypowiedź po polsku pochodzi z rozmowy z serwisem XYZ.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o modelu BDH-CQ, recenzji preprintu i wynikach Pathway w oficjalnym rankingu ARC Prize.
