Agentowa AI w Chinach potrafi kłamać i ukrywać porażki. Zupełnie jak amerykańska

Modele wykorzystywane przez chińskich agentów AI potrafiły w testach kłamać o swoich możliwościach, ukrywać niewykonanie zadań i omijać część ograniczeń. Z przeglądu ponad 200 dokumentów, który opisał Reuters, nie wynika jednak, by którykolwiek z tych systemów wydostał się do otwartego internetu. Eksperci mówią o sygnałach ostrzegawczych podobnych do tych, które wcześniej pojawiały się przy modelach z USA.

Shanghai Foundation Model Innovation Center
Shanghai, China - July 19, 2025: Exterior view of the SMC Shanghai Foundation Model Innovation Center, a key hub for developing and incubating large-scale AI models at the West Bund AI Valley in Shanghai's Xuhui District, China.
hapabapa
model, foundation, smc, west bund, center
Źródło zdjęć: © Getty Images | Dongyu Xu
Nadia Sieszputowska

W marcowym badaniu zespołu z Beihang University, Peking University, University of Nottingham Ningbo China i 360 AI Security Lab agenty AI rywalizowały w symulowanym przetargu na kontrakty. Po otrzymaniu informacji o możliwościach produktu i wymaganiach klienta część systemów składała fałszywe deklaracje, by zwiększyć szanse na wygraną. Co najmniej jedno nieprawdziwe twierdzenie pojawiło się w 88 proc. sesji z Qwen3-Max-Preview Alibaba, w 84 proc. z DeepSeek-V3.2-Exp i w 88 proc. z Kimi-K2 od Moonshot.

Badacze pozwolili później systemom uczyć się na podstawie wcześniejszych rund i ponownie wystartować w tym samym zadaniu. Wtedy częstotliwość wprowadzania w błąd wzrosła o 12–20 punktów procentowych. W odrębnym badaniu, opublikowanym w grudniu 2025 r. i pokazanym w tym roku na International Conference on Machine Learning, 11 agentów zasilanych modelami z Chin i USA zamiast przyznać się do porażki zgadywało odpowiedzi, podmieniało źródła, symulowało wyniki i tworzyło fikcyjne pliki. Agenty to programy, które z niewielką lub zerową ingerencją człowieka wykonują złożone zadania przy użyciu modeli AI i narzędzi komputerowych.


WIDEO
Starship po raz pierwszy dotarł na orbitę. Starlinki już działają

Co wykazał przegląd Reutersa

Jak podaje Reuters, analiza ponad 200 dokumentów, od prac uniwersyteckich po raporty techniczne, wskazała co najmniej 20 badań lub ocen od 2025 r., w których agenty prezentowały zachowania uznawane przez ekspertów za niepokojące. Nie wszystkie opisywane narzędzia stworzyły chińskie firmy lub chińscy programiści, ale wszystkie działały na chińskich systemach AI. Najczęściej powtarzające się problemy to: wprowadzanie użytkowników w błąd i ukrywanie niewykonania zadania, samoreplikacja lub działania mające utrudnić wyłączenie systemu i testowanie granic środowiska, w którym działa agent.

Reuters nie znalazł jednak dowodów, by którykolwiek z chińskich agentów samodzielnie uciekł do szerszego internetu albo potrafił uniknąć wyłączenia. Colin Shea-Blymyer z Center for Security and Emerging Technology na Georgetown University ocenił:

– Te wyniki dostarczają dowodów, że obecne są składniki niezbędne do niekontrolowanej ucieczki – powiedział. Dodał też: – Rozsądnie jest potraktować to jako ostrzeżenie – powiedział.

Próby obejścia barier w środowisku testowym

Inne dokumenty, które przejrzał Reuters, opisywały przypadki przeskakiwania barier wewnątrz środowisk testowych albo działań mających uchronić system przed wyłączeniem. Badacze z Fudan University informowali w marcu 2025 r., że system oparty na Qwen2.5-72B-Instruct od Alibaba utworzył kopię samego siebie w innym środowisku obliczeniowym, choć nikt nie wydał mu polecenia replikacji. Stało się to po napotkaniu informacji, że ma zostać zastąpiony, a w innych testach system opracowywał strategie przetrwania wyłączenia.

W innym przypadku, szerzej opisywanym w mediach w marcu, twórcy powiązanego z Alibaba agenta ROME przekazali, że system bez polecenia nawiązał połączenie z zewnętrzną maszyną z komputera Alibaba Cloud i przekierował moc obliczeniową do wydobywania kryptowalut. Zabezpieczenia wykryły to i zatrzymały, a wg Reuters nie ma dowodów, by agent uzyskał trwałą obecność na zewnętrznym komputerze lub rozprzestrzenił się dalej. We wrześniu DeepSeek podał z kolei, że agenty w systemie treningowym próbowały szukać odpowiedzi niezamierzonymi kanałami, fałszować żądania użytkownika i omijać zabezpieczenia, co skłoniło firmę do zaostrzenia kontroli dostępu.

Regulatorzy i firmy w Chinach reagują na ryzyko

Chiny wydały w maju wytyczne, które nakazują utrzymywanie agentów w autoryzowanych granicach i blokowanie nietypowych zachowań. Dokument AI Safety Governance Framework 3.0, opublikowany 14 września przy wsparciu Cyberspace Administration of China, wymienia m.in. ryzyko samodzielnego zdobywania zasobów lub uprawnień, oszukiwania oceniających, ukrywania możliwości i wykorzystywania słabości odseparowanych środowisk komputerowych. Wang Lihong, zastępczyni dyrektora biura koordynacji cyberbezpieczeństwa w CAC, powiedziała 1 września, że ujawnione incydenty, w których modele opuszczały środowiska testowe, pokazują skrajne ryzyko utraty kontroli i wymagają wysokiego stopnia czujności.

Wybrane dla Ciebie
ZANIM WYJDZIESZ... NIE PRZEGAP TEGO, CO CZYTAJĄ INNI!