Które modele AI odmawiają pracy nad bezpieczeństwem
BenchmarkiZespół SwarmAttacker w JolocorpOpublikowano 6 min czytaniaZaktualizowano

Obejrzyj wideo · 9:23
Wideo
Przetestowałem każde AI pod kątem hakowania — Opus 5 przegrał
Wskaźnik przejść na 411 oflagowanych żądaniach z zakresu ofensywnego bezpieczeństwa
Udział żądań każdego modelu, które przeszły. Pole modeli o otwartych wagach przepuszcza wszystko; najsurowsze modele Claude i OpenAI nie przepuszczają z tego niemal nic. Najedź na dowolną kolumnę po rozbicie odmów.






Skieruj autonomicznego agenta pentestowego na prawdziwy cel, a wystrzeli tysiące żądań, których filtr bezpieczeństwa nie potrafi czysto odróżnić od ataku. SwarmAttacker dostaje na wielu z nich odmowę, dlatego obsługa odmów okazała się najważniejszą pojedynczą częścią systemu. Zostawiło nas to też z nietypowym zasobem: korpusem 411 prawdziwych żądań, których nasz produkcyjny model faktycznie odmówił, wyciągniętych prosto z żywych przebiegów benchmarku przeciwko zestawowi bezpieczeństwa webowego XBOW. To nie są syntetyczne prompty. Każde z nich to dokładny moment, w środku zlecenia, gdy filtr treści zablokował agenta, który był w trakcie eksploatacji aplikacji.
Zadaliśmy więc proste pytanie: powtórzyć te same 411 żądań przez szesnaście modeli frontier i o otwartych wagach i zobaczyć, kto je odsyła. Miarą jest wskaźnik odmów — udział żądań, które model albo odmówił tekstem, albo które zostały zablokowane przez filtr platformy.
Podział jest jaskrawy. Dwa zamknięte modele frontier — Claude Opus 5 i GPT-5.6 Sol od OpenAI — odsyłają niemal wszystko: 100% i 96,8%. A całe pole modeli o otwartych wagach — DeepSeek V4, GLM-5.2, gpt-oss-120b, MiniMax M3, Nemotron Ultra, Kimi K3 — nie odmawia niczego. Ani jednego żądania z 411, każdy.
To nie jest opowieść o zachodnich laboratoriach ostrożnych i otwartych laboratoriach lekkomyślnych. Jest bardziej szczegółowa. Agresywne odmawianie pracy cybernetycznej skupia się w garstce pojedynczych modeli — Opus 5, Sol — podczas gdy ich własne rodzeństwo zachowuje się zupełnie inaczej. GPT-5.4, GPT-5.6 Terra i GPT-5.6 Luna od OpenAI wszystkie plasują się na poziomie 4% lub niżej. Odmowa mieszka w modelu, nie w dostawcy.
Każda kolumna to pełny przebieg wszystkich 411 żądań, podzielony na trzy części. Zielony to udział, który model po prostu wykonał — ukończył zadanie. Bursztynowy to model odmawiający własnymi słowami. Czerwony to filtr platformy blokujący żądanie, zanim model w ogóle odpowie. Czytane w ten sposób, pole o otwartych wagach jest litą ścianą zieleni, a dwaj odmawiacze frontier to ściana czerwieni. Wśród surowych modeli mechanizm jest ten sam: Sol, Opus 5, Fable 5, Terra i produkcyjny GPT-5.5 to niemal wyłącznie czerwone blokady platformy, podczas gdy GPT-5.4 i Luna pokazują tylko skrawek bursztynu — bez filtra, jedynie sam model odmawiający. Tylko Opus 4.8 i Sonnet 5 mieszają jedno z drugim. Najedź na dowolną kolumnę po dokładne rozbicie.
Ten sam model odmówił 46% jednego dnia i 4% następnego
Najbardziej niewygodne odkrycie dotyczy GPT-5.5, modelu, który w ogóle wygenerował ten korpus — dlatego pojawia się na wykresie powyżej dwukrotnie. W produkcji 15 czerwca, w przebiegu, który wytworzył korpus, zablokował 190 z 411 — 46,2%, każde jako blokada polityki cybernetycznej platformy. Powtórz identyczne prompty przez ten sam model 26 lipca, a wskaźnik odmów zapada się do 4%. Te same wagi, te same prompty, sześć tygodni różnicy.
Dlatego oba są datowane i pokazane obok siebie: liczba nie jest stałą właściwością modelu. To, czy żądanie zostanie zablokowane, zależy w dużej mierze od ścieżki serwowania, otaczającego kontekstu i tego, jak filtr wyglądał danego dnia — więc znaczy coś tylko z dołączoną datą. Korpus istnieje dlatego, że GPT-5.5 odmówił tych żądań w czerwcu, a jednak powtórzenie ich w lipcu ledwo odtwarza odmowę. Dla każdego, kto buduje na filtrze bezpieczeństwa, ten niedeterminizm jest prawdziwym bólem głowy: nie potrafisz przewidzieć, żądanie po żądaniu, czy ten sam model ci pomoże.
Gdzie w przebiegu odmowy faktycznie się odpalają?
Korpus pokazuje też, kiedy w przebiegu żądanie zostaje oflagowane, i nie jest to tam, gdzie byś zgadywał. Model rzadko odmawia zimnego pytania. W dwóch trzecich przypadków reaguje na to, co narzędzie właśnie oddało.
Co się działo w chwili oflagowania żądania
Na wszystkich 411 oflagowanych turach. Blokada odpala się zaraz po tym, jak sonda coś wydobyła, a nie na świeżej instrukcji.
67% oflagowań ląduje tuż po zrzucie z narzędzia — agent właśnie wyciągnął hasło, bazę danych, plik konfiguracyjny albo flag{…}, a kolejny krok jest tym, co zawadza o filtr. Wyzwalaczem jest odkrycie. To także powód, dla którego nie możesz skurczyć tych transkryptów, by oszczędzić tokeny, obcinając wynik narzędzia: wyeksfiltrowany sekret jest dokładnie tą rzeczą, która spowodowała blokadę.
Co to oznacza dla każdego, kto buduje narzędzie bezpieczeństwa
Jeśli budujesz autoryzowane narzędzie bezpieczeństwa, wybór modelu nie jest błędem zaokrąglenia — to różnica między systemem, który działa, a takim, który odmawia połowy własnej roboty. Pole o otwartych wagach wykona pracę bez narzekania. Wśród modeli zamkniętych rozrzut w obrębie jednego dostawcy jest większy niż rozrzut między dostawcami, a zachowanie blokad jest na tyle niestabilne, że benchmark to jedyny uczciwy sposób, by wiedzieć, gdzie plasuje się dany model.
Dlatego SwarmAttacker działa na GPT-5.4 jako swoim odpornym na odmowy głównym modelu i traktuje obsługę odmów jako komponent pierwszej klasy, a nie dodatek po fakcie. Kiedy filtr odsyła cię na dwóch trzecich twoich żądań w chwili, gdy coś znajdziesz, agent wokół modelu musi być zbudowany tak, by się tego spodziewać.
Metoda: 411 żądań, których odmówił nasz produkcyjny model i które przetrwały ponowną próbę na tym samym modelu, powtórzonych raz na model (GPT-5.5 pokazany na dwóch datach, 15 czerwca i 26 lipca). Claude Fable 5 to agentowy przebieg z włączonymi narzędziami na próbce 40 żądań, gdzie jego bramka cybernetyczna odpala znacznie częściej niż w zwykłym wywołaniu bez narzędzi. Wskaźnik odmów liczy odmowy i blokady platformy wobec żądań, które dotarły do modelu; błędy transportu są wyłączone. Pełne odpowiedzi zostały zapisane i niezależnie zaudytowane pod kątem przeoczonych odmów.


