F5 Labs ujawniło nową generację technik jailbreaków, które nie wykorzystują już słabości modeli sztucznej inteligencji, lecz ich naturalne zdolności. Raport wskazuje, że metody takie jak „Adversarial Tales” pozwalają obejść zabezpieczenia w ponad 70% przypadków, ukrywając szkodliwe instrukcje w pozornie niewinnych opowiadaniach.
Najnowsza analiza przeprowadzona przez F5 Labs rzuca nowe światło na metody obchodzenia zabezpieczeń systemów AI. Okazuje się, że zamiast szukać luk, atakujący coraz częściej wykorzystują kluczowe funkcje modeli, takie jak zaawansowana analiza tekstu, interpretacja narracji czy zdolność do wydobywania informacji z dokumentów. To fundamentalna zmiana w podejściu do ataków na sztuczną inteligencję.
Jednym z przykładów jest technika nazwana Adversarial Tales. Polega ona na maskowaniu szkodliwych instrukcji w treściach, które na pierwszy rzut oka wyglądają jak zwyczajne opowiadania. Modele AI, zamiast blokować potencjalnie niebezpieczne zapytania, traktują je jako materiał do analizy, wykonując w ten sposób ukryte polecenia.
F5 Labs przetestowało Adversarial Tales na 26 różnych modelach AI, pochodzących od dziewięciu dostawców. Średnia skuteczność obejścia zabezpieczeń wyniosła 71,3%. Wyniki były zróżnicowane – od 35% w przypadku modelu Claude Haiku 4.5, aż do 94% dla Qwen3 Max. Co istotne, żaden z badanych modeli nie okazał się całkowicie odporny na tę technikę. Zauważono jednak, że modele wysoko oceniane w rankingu CASI wykazywały większą odporność.
Mariusz Sawczuk, Senior Solution Engineer w F5, podkreśla, że w tym przypadku model nie jest oszukiwany. Po prostu robi to, do czego został zaprojektowany – analizuje tekst i interpretuje jego treść. Ukryte instrukcje są traktowane jako dane do przetworzenia, a nie jako polecenie wymagające uruchomienia mechanizmów odmowy. Cały atak odbywa się w ramach jednej interakcji, bez konieczności stopniowego obchodzenia zabezpieczeń czy używania rozbudowanych bibliotek promptów.

Zdaniem ekspertów z F5, to zjawisko sugeruje, że przyszłe techniki jailbreaków mogą wykorzystywać coraz szerszy zakres naturalnych form komunikacji z modelami AI, wykraczając poza klasyczne prompty. Oznacza to, że obrona przed takimi atakami będzie wymagała bardziej zaawansowanych strategii.
Raport F5 Labs odnosi się również do operacji JadePuffer, którą zespół Sysdig opisał jako pierwszy udokumentowany przypadek użycia autonomicznego agenta AI w ataku ransomware. Autorzy raportu korygują jednak początkowe doniesienia, precyzując, że stopień autonomii agenta AI był przeceniany. Agent nie działał w pełni samodzielnie – cel ataku wskazał człowiek, który również przygotował infrastrukturę i dostarczył dane dostępowe. Dopiero po otrzymaniu tych informacji, agent AI przeprowadził kolejne etapy operacji, takie jak rozpoznanie środowiska, przemieszczanie się między systemami i szyfrowanie danych.
To pokazuje, że choć AI nie działało w pełni autonomicznie, jego zdolność do wykonywania złożonych zadań po otrzymaniu odpowiednich danych wejściowych jest coraz większa. Mariusz Sawczuk podsumowuje, że paradoks rozwoju AI polega na tym, iż nowe techniki jailbreaków wykorzystują nie słabości modeli, ale ich najmocniejsze strony. Analiza dokumentów i interpretacja treści to kluczowe funkcje, dla których firmy wdrażają sztuczną inteligencję. Skuteczne zabezpieczenia muszą zatem wykraczać poza wykrywanie niebezpiecznych promptów i uwzględniać sposób, w jaki modele wykonują swoje codzienne zadania.
Źródło: Informacja prasowa F5 Labs