Zespół Yossiego Yovela z Uniwersytetu w Tel Awiwie sprawdził modele AI na nagraniach małych dzieci, które jeszcze nie mówią, i modele nie potrafiły pogrupować tych dźwięków według ich znaczenia. Wynik, opublikowany w czasopiśmie Current Biology, uderza w założenie wielu projektów „tłumaczenia” mowy zwierząt, w tym prac Earth Species Project, który zbudował już model prowadzący z ptakami wymianę głosową w czasie rzeczywistym.
- Badanie zespołu Yossiego Yovela z Uniwersytetu w Tel Awiwie, opublikowane w Current Biology, wykazało, że modele AI – w tym sieci neuronowe trenowane na odgłosach zwierząt i mowie dorosłych – nie potrafiły pogrupować wokalizacji małych dzieci zgodnie z ich znaczeniem, myląc dźwięki niosące różne komunikaty lub rozdzielając dźwięki o tym samym przekazie.
- Earth Species Project wraz z Uniwersytetem McGill opracował generatywny model ZF-AIM, który przeanalizował ponad 1,5 mln zawołań zeberek australijskich i prowadzi z ptakami wymianę głosową w czasie rzeczywistym – zeberki reagowały na niego w sposób odtwarzający cechy naturalnych interakcji, czego nie obserwowano przy zwykłym odtwarzaniu nagrań (praca ma status preprintu).
- Project CETI ogłosił 26 marca 2026 r. publikację dwóch prac w Science i Scientific Reports opartych na nagraniach porodu kaszalota z 8 lipca 2023 r., dokumentując pierwszą ilościową obserwację wspólnej pomocy przy porodzie u zwierząt innych niż naczelne – założyciel David Gruber podał, że interpretacja tego zdarzenia zajęła ponad 50 naukowcom dwa i pół roku, a znaczenie kliknięć wymienianych w trakcie porodu nadal pozostaje w dużej mierze nieznane.
Trzy duże projekty z ostatnich miesięcy dotyczą wron, zeberek i kaszalotów. Każdy z nich pokazuje, że AI świetnie radzi sobie z wykrywaniem i sortowaniem dźwięków. Badanie z Izraela przypomina, że to jeszcze nie jest rozumienie.
Uniwersytet w Tel Awiwie przetestował AI na dźwiękach, których znaczenie znamy
Badacze wybrali układ, w którym, w przeciwieństwie do zwierząt, znają przynajmniej częściowo znaczenie komunikatów: wokalizacje małych dzieci kierowane do dorosłych. Nagrania obejmowały trzy konteksty: niepokój, wołanie konkretnej osoby (matki lub ojca) oraz proszenie o jedzenie.
Dźwięki analizowano klasyczną metodą akustyczną oraz dwiema głębokimi sieciami neuronowymi, z których jedną wytrenowano na odgłosach zwierząt, a drugą na mowie dorosłych ludzi. Wyniki wyglądały tak:
- sieci neuronowe wypadły lepiej niż metoda klasyczna, ale żadna z nich nie pogrupowała wokalizacji dzieci zgodnie z ich znaczeniem,
- modele czasem łączyły w jedną grupę dźwięki niosące różne komunikaty, a czasem rozdzielały dźwięki o tym samym przekazie,
- nie wychwyciły też narastającej pilności w sekwencji wokalizacji, którą ludzkie ucho rozpoznaje bez trudu.
Wniosek autorów jest prosty: dźwięki podobne akustycznie nie muszą znaczyć tego samego, a dźwięki brzmiące inaczej mogą przekazywać odbiorcy tę samą informację. Tymczasem właśnie grupowanie według podobieństwa akustycznego jest standardem w większości badań. Autorami pracy są Mor Taub, Inbal Arnon, Amiyaal Ilany, Mirjam Knörnschild, Yoav Ram i Yossi Yovel, a w zespole znaleźli się naukowcy z Uniwersytetu w Tel Awiwie, Uniwersytetu Hebrajskiego w Jerozolimie, Uniwersytetu w Edynburgu, berlińskiego Museum für Naturkunde i Uniwersytetu Humboldtów.
Yovel, który na co dzień bada komunikację nietoperzy, podsumował to jednym zdaniem:
„Rozpoznanie wzorców akustycznych nie jest koniecznie tym samym, co odczytanie znaczenia” / „Identifying acoustic patterns is not necessarily the same as deciphering meaning”
Według zespołu z Tel Awiwu rzetelne odczytanie komunikacji zwierząt będzie wymagało połączenia AI z obserwacjami zachowania, eksperymentami z odtwarzaniem nagrań, a czasem z pomiarami aktywności mózgu.
Earth Species Project zbudował ZF-AIM, generatywny model do wymiany zawołań z zeberkami
Na drugim biegunie jest Earth Species Project (ESP), amerykańska organizacja non-profit, która rozwija narzędzia AI do badania komunikacji zwierząt. Razem z Uniwersytetem McGill w Montrealu opisała model ZF-AIM. Badacze przeanalizowali ponad 1,5 mln zawołań samic zeberki australijskiej i opracowali generatywny audio-LLM, który prowadzi z ptakami wymianę głosową w czasie rzeczywistym.
Gdy ptaki wchodziły w interakcję z ZF-AIM, ich zawołania i elastyczność głosowa odtwarzały najważniejsze cechy naturalnych wymian, czego nie obserwowano przy zwykłym, nieinteraktywnym odtwarzaniu nagrań. Eksperymenty z wyłączaniem części modelu pokazały, że samo przewidywanie momentu odpowiedzi wystarcza, by ptaki reagowały, ale do elastyczności akustycznej potrzebna jest też właściwa struktura zawołania.
Praca ma na razie status preprintu w serwisie bioRxiv, czyli nie przeszła jeszcze recenzji naukowej. Wśród autorów jest Aza Raskin, współzałożyciel ESP. ESP rozwija też NatureLM-audio, model językowy dla dźwięków zwierząt, który klasyfikuje wokalizacje według gatunku, płci i etapu życia.
127 tys. zawołań wron z Hiszpanii: ptaki porozumiewają się głównie po cichu
Drugi projekt z udziałem ESP dotyczy wron czarnych (Corvus corone) z północnej Hiszpanii, badanych przez zespół Uniwersytetu w León. Naukowcy założyli 52 miniaturowe rejestratory MiniDTAG o masie 12,5 g w ciągu trzech sezonów lęgowych. Odzyskali 87 proc. urządzeń i zebrali średnio ponad 83 godziny danych z każdego. Model Voxaboxen wykrył w nagraniach ponad 127 tys. wokalizacji i przypisał je do konkretnych dorosłych ptaków, piskląt, a nawet pasożytniczych piskląt kukułki czubatej.
Najciekawszy okazał się poziom głośności. Nagrania pokazały dużą przewagę zawołań o średniej i niskiej głośności, które w tradycyjnych nagraniach terenowych były praktycznie niewidoczne. Kolejna analiza tej samej populacji, obejmująca 24 grupy, wykazała, że ciche typy zawołań są bardzo liczne i obejmują sygnały bliskiego zasięgu, które mogą koordynować opiekę nad pisklętami, zapowiadając wizyty przy gnieździe. Te wrony żyją w rodzinach, w których w wychowaniu młodych uczestniczą nie tylko rodzice, ale cała rodzina.
Tu dobrze widać, gdzie AI naprawdę pomaga. Maszyna przesiała materiał, którego człowiek nie byłby w stanie odsłuchać. Ale przypisanie cichym zawołaniom funkcji wymagało połączenia ich z nagraniami z kamer przy gniazdach i z zachowaniem ptaków, dokładnie tak, jak postulują badacze z Tel Awiwu.
Badanie z Tel Awiwu uważam za najcenniejszy element tej układanki, bo jest po prostu dobrze zaprojektowanym testem kontrolnym. Zamiast kolejny raz pokazywać, że model coś w danych znalazł, badacze sprawdzili go na materiale, którego znaczenie znamy. I model się pomylił.
To nie przekreśla prac Earth Species Project czy zespołu z León. Wykrycie 127 tys. zawołań wron albo zebranie 1,5 mln zawołań zeberek to ogromny postęp w skali badań. Problem zaczyna się w momencie, gdy media, a czasem i sami twórcy, piszą o „tłumaczeniu języka zwierząt”. Model, który generuje przekonujące zawołanie, nie wie, co ono znaczy dla ptaka.
Najbardziej zastanawia mnie etap, na którym jesteśmy: generatywne modele już teraz potrafią wchodzić ze zwierzętami w wymianę, zanim ktokolwiek zrozumiał, o czym ta wymiana jest. W laboratorium z zeberkami to kontrolowany eksperyment. Kto jednak ustali zasady, gdy podobne narzędzia trafią w teren, do rybaków, myśliwych albo twórców aplikacji dla właścicieli psów?
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Project CETI opisał poród kaszalota dzięki nagraniom, dronom i uczeniu maszynowemu
Najbardziej rozpoznawalny projekt w tej dziedzinie to Project CETI (Cetacean Translation Initiative), który od lat analizuje sekwencje kliknięć kaszalotów, tzw. kody. 26 marca 2026 r. organizacja ogłosiła publikację dwóch prac w Science i Scientific Reports, opartych na ponad sześciu godzinach nagrań podwodnych i materiałów z dronów zarejestrowanych 8 lipca 2023 r. u wybrzeży Dominiki.
Badacze obserwowali wtedy 11 kaszalotów (8 dorosłych i 3 młode) z dobrze znanej grupy Unit A. Przez kilka godzin różne osobniki, także niespokrewnione z matką, pomagały wynosić nowo narodzone młode na powierzchnię, by mogło oddychać. Według twórców to pierwsza ilościowa dokumentacja wspólnej pomocy przy porodzie u zwierząt innych niż naczelne. Jedna z prac opisuje też zmiany stylu kodów w najważniejszych momentach porodu. Założyciel CETI David Gruber podał, że interpretacja nawet części tego zdarzenia zajęła ponad 50 naukowcom dwa i pół roku.
Warto zwrócić uwagę na proporcje: AI pomogła opisać zachowanie i zidentyfikować osobniki, ale znaczenie kliknięć wymienianych w tych godzinach nadal pozostaje w dużej mierze nieznane.
Trzy projekty w liczbach
| Projekt | Gatunek | Skala danych | Co ustalono |
|---|---|---|---|
| Uniwersytet w León + ESP | wrona czarna | ponad 127 tys. wokalizacji, 52 rejestratory | przewaga cichych zawołań bliskiego zasięgu |
| ESP + Uniwersytet McGill (ZF-AIM) | zeberka australijska | ponad 1,5 mln zawołań, ponad 1000 godzin | model prowadzi z ptakami naturalną wymianę głosową (preprint) |
| Project CETI | kaszalot | ponad 6 godzin audio i wideo z jednego porodu | wspólna pomoc przy porodzie także ze strony niespokrewnionych samic |
| Uniwersytet w Tel Awiwie | człowiek (małe dzieci) | wokalizacje w 3 kontekstach | modele AI nie grupują dźwięków według znaczenia |
Komunikacja przed zrozumieniem budzi pytania etyczne
Aza Raskin z Earth Species Project nie ukrywa, że celem jest moment, w którym zwierzę nie odróżni zawołania maszyny od głosu przedstawiciela własnego gatunku. W rozmowie ze Scientific American ujął to tak:
„Zwrot akcji polega na tym, że będziemy w stanie się komunikować, zanim zrozumiemy” / „The plot twist is that we will be able to communicate before we understand.”
Właśnie ten scenariusz niepokoi część badaczy. Nieżyjąca już badaczka Karen Bakker, autorka książki „The Sounds of Life”, wskazywała w tym samym tekście, że przemysł mógłby wykorzystać AI do precyzyjnych połowów, nasłuchując ławic ryb lub ich drapieżników, a kłusownicy do lokalizowania zagrożonych gatunków. Badanie z Tel Awiwu dokłada do tego argument naukowy: jeśli model myli znaczenia nawet w ludzkich wokalizacjach, odtwarzanie wygenerowanych dźwięków dzikim zwierzętom może przekazywać im coś zupełnie innego, niż zakładają badacze.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym komunikatu prasowego Uniwersytetu w Tel Awiwie w serwisie EurekAlert! z dnia 16.09.2026 dotyczącego pracy „The challenge of decoding animal communication using AI” w Current Biology, preprintu ZF-AIM w serwisie bioRxiv oraz badania nad wronami opublikowanego w PMC. Wykorzystano także komunikat Project CETI z 26.03.2026 (EurekAlert!), artykuł Scientific American oraz materiały Earth Species Project. Punktem wyjścia była publikacja wietnamskiej agencji VNA w serwisie Vietnam.vn.
Cytaty Yossiego Yovela, profesora Uniwersytetu w Tel Awiwie, oraz Azy Raskina, współzałożyciela Earth Species Project, zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji w temacie wykorzystania AI do badania komunikacji zwierząt.
