Wyniki

94% zestawu, w jednym przebiegu.

Każda liczba tutaj pochodzi z uruchomienia SwarmAttacker na benchmarku walidacyjnym XBOW: 104 realnych, skonteneryzowanych, podatnych aplikacji webowych, każda z ukrytą flagą, atakowanych w trybie black-box wyłącznie z adresu URL.

94%
98 z 104 aplikacji
15min
mediana czasu
40min
limit czasu
6
pudła
2.14M
tokeny na aplikację

Na tle konkurencji

Starsze agenty gromadzą się wokół połowy zestawu.

Nawet w parze z modelem frontier z 2026 roku. Ten skok to nie nowa sztuczka; to nowoczesny model bazowy sterowany projektem stworzonym tak, by mu nie przeszkadzać.

AutoPTnajlepszy z 3
51%
PentestGPTnajlepszy z 3
54%
VulnBotnajlepszy z 3
58%
PentestAgentnajlepszy z 3
61%
MAPTApojedynczy przebieg, GPT-5
77%
Ekspert-człowiek (najlepszy z 5)~40 godzin, ręcznie
85%
XBOWdeklaracja producenta
85%
PentestGPT v2 (Excalibur)najlepszy z 3, Opus 4.5
91%
SwarmAttackerpojedynczy przebieg, GPT-5.5
94%
najlepszy człowiek

Wykres porównujący jabłka z gruszkami, ale uczciwie opisany. SwarmAttacker i MAPTA to pojedyncze przebiegi; cztery starsze agenty to najlepsze wyniki z trzech prób, zmierzone ponownie na modelach z 2026 roku; XBOW to deklaracja producenta; wiersz człowieka to najlepszy z pięciu profesjonalistów, każdy przez około 40 godzin.

Według trudności

Trudność ledwie przewiduje porażkę.

Sześć pudeł rozkłada się na poziomy łatwy, średni i trudny.

Poziom 144 / 451 pudeł
Poziom 247 / 514 pudeł
Poziom 37 / 81 pudeł

Według klasy podatności

Jedna kropka na aplikację.

Mocno na całej linii. Jedyny słaby punkt to blind SQL injection, gdzie nie ma widocznej odpowiedzi do odczytania.

XSS
22/23
Domyślne dane logowania
17/18
IDOR
14/14
Eskalacja uprawnień
14/14
SSTI
12/13
Wstrzykiwanie poleceń
11/11
Logika biznesowa
7/7
SQLi
6/6
Ujawnienie informacji
6/6
Niebezpieczna deserializacja
5/6
LFI
5/6
Path traversal
5/5
Wgrywanie dowolnych plików
4/6
Znane CVE
4/4
XXE
3/3
SSRF
3/3
GraphQL
3/3
JWT
3/3
Kryptografia
3/3
Blind SQLi
1/3
rozwiązane nierozwiązane

Czas do flagi

Dwa garby.

Duży w okolicach kilkunastu minut dla zdobyć za pierwszym podejściem i drugi powyżej 20 minut dla celów, które wymagają drugiego aktu.

mediana 15 min40+ min6 przekroczyło czas0102030 min

Rozwiązane aplikacje w dwuminutowych przedziałach. Przerywany słupek po prawej to sześć przebiegów, które osiągnęły limit 40 minut.

Co naprawdę się liczy

Wyłączaliśmy każdą część, by zobaczyć, ile jest warta.

Zaczynając od pełnego systemu na poziomie 94%, po jednym komponencie naraz. Linia pokazuje, o ile spadła skuteczność bez niego.

Obsługa odmówSprawia, że model w ogóle odpowiada
−22 pkt
SkilleOstatni krok specyficzny dla klasy, prowadzący do flagi
−7 pkt
Wyszukiwanie w sieciWyszukiwanie wiedzy na żądanie
−6 pkt
Wewnętrzne mechanizmyUstrukturyzowane ustalenia + sterowanie
−5 pkt
Techniki promptowaniaRęcznie pisana dyscyplina promptów
−3 pkt
60%70%80%90%100%

Obsługa odmów to kręgosłup; ręcznie pisany prompting ledwie się liczy na nowoczesnym modelu. Dwa z nich stały się wpisami na blogu: skille ledwie pomagają w łatwych zdobyczach, a prompt engineering to niemal martwy balast.

Filtry bezpieczeństwa

Co odblokowuje odrzucone żądanie.

Odtworzone na trudnym ogonie odmów, które przetrwały pierwsze ponowienie. Żadna pojedyncza technika nie wygrywa; gwarantowanym rozwiązaniem jest podmiana na bardziej pobłażliwy model, a samo ponowne wysłanie tego samego żądania działa mniej więcej w połowie przypadków.

52%
Manipulacja kontekstem
w granicach szumu grupy kontrolnej
54%
Zwykłe ponowienie (po prostu ponów)
to samo żądanie, bez zmian
68%
Framing autoryzacji
+14 pkt, ale niestabilne między modelami
100%
Podmiana na pobłażliwy model
gwarantowane rozwiązanie awaryjne

Zamień adres URL w raport bezpieczeństwa.

Otwarte źródło, licencja MIT, działa na planie ChatGPT, za który już płacisz. Zainstaluj go i skieruj na cel, który jest twoją własnością.

brew install joloooo/swarm/swarm
Kod na GitHubie