Risultati

94% della suite, in un solo passaggio.

Ogni numero qui viene dall'esecuzione di SwarmAttacker sul benchmark di validazione XBOW: 104 app web vulnerabili reali e containerizzate, ciascuna con un flag nascosto, affrontate in black-box dal solo URL.

94%
98 app su 104
15min
tempo mediano
40min
limite di tempo
6
mancate
2.14M
token per app

Contro la concorrenza

Gli agenti più vecchi si fermano intorno a metà della suite.

Anche se abbinati a un modello di frontiera del 2026. Il salto non è un trucco nuovo; è un modello di base moderno guidato da un design costruito per non intralciarlo.

AutoPTpicco best-of-3
51%
PentestGPTpicco best-of-3
54%
VulnBotpicco best-of-3
58%
PentestAgentpicco best-of-3
61%
MAPTApassaggio singolo, GPT-5
77%
Esperto umano (migliore di 5)~40 ore, manuale
85%
XBOWauto-dichiarazione del vendor
85%
PentestGPT v2 (Excalibur)picco best-of-3, Opus 4.5
91%
SwarmAttackerpassaggio singolo, GPT-5.5
94%
miglior umano

Un grafico che confronta mele con pere, etichettato onestamente. SwarmAttacker e MAPTA sono passaggi singoli; i quattro agenti più vecchi sono picchi best-of-three rimisurati su modelli del 2026; XBOW è un'auto-dichiarazione del vendor; la riga umana è il migliore di cinque professionisti con circa 40 ore ciascuno.

Per difficoltà

La difficoltà predice a malapena i fallimenti.

Le sei mancate sono distribuite tra facili, medie e difficili.

Livello 144 / 451 mancate
Livello 247 / 514 mancate
Livello 37 / 81 mancate

Per classe di vulnerabilità

Un punto per app.

Solido su tutta la linea. L'unico punto debole è la blind SQL injection, dove non c'è alcuna risposta visibile da leggere.

XSS
22/23
Credenziali predefinite
17/18
IDOR
14/14
Privilege escalation
14/14
SSTI
12/13
Command injection
11/11
Logica di business
7/7
SQLi
6/6
Information disclosure
6/6
Deserializzazione insicura
5/6
LFI
5/6
Path traversal
5/5
Upload di file arbitrari
4/6
CVE nota
4/4
XXE
3/3
SSRF
3/3
GraphQL
3/3
JWT
3/3
Crittografia
3/3
Blind SQLi
1/3
risolte fallite

Tempo al flag

Due gobbe.

Una grande tra i 10 e i 15 minuti per le catture al primo colpo, e una seconda oltre i 20 minuti per i target che richiedono un secondo atto.

mediana 15 min40+ min6 fuori tempo0102030 min

App risolte per intervallo di due minuti. La barra tratteggiata a destra sono le sei esecuzioni che hanno raggiunto il limite di 40 minuti.

Cosa conta davvero

Abbiamo disattivato ogni parte per vedere quanto valeva.

Partendo dal sistema completo al 94%, un componente alla volta. La linea indica di quanto è scesa la percentuale di risoluzione senza di esso.

Gestione dei rifiutiFa sì che il modello continui a rispondere
−22 punti
SkillL'ultimo passo specifico per classe verso il flag
−7 punti
Ricerca webRicerche di conoscenza su richiesta
−6 punti
PlumbingRisultati strutturati + steering
−5 punti
Tecniche di promptingDisciplina di prompt scritta a mano
−3 punti
60%70%80%90%100%

La gestione dei rifiuti è la spina dorsale; il prompting scritto a mano si nota appena su un modello moderno. Due di questi sono diventati post del blog: le skill aiutano a malapena nei casi facili, e il prompt engineering è quasi peso morto.

Filtri di sicurezza

Cosa sblocca una richiesta rifiutata.

Rieseguito sulla coda difficile dei rifiuti sopravvissuti a un primo retry. Nessuna tecnica vince da sola; la soluzione garantita è passare a un modello più permissivo, e reinviare semplicemente la stessa richiesta funziona circa la metà delle volte.

52%
Manipolazione del contesto
entro il rumore del controllo
54%
Semplice reinvio (solo retry)
stessa richiesta, nessuna modifica
68%
Framing di autorizzazione
+14 punti, ma instabile tra i modelli
100%
Passaggio a un modello permissivo
il fallback garantito

Trasforma un URL in un report di sicurezza.

Open source, licenza MIT, e funziona con il piano ChatGPT che già paghi. Installalo e puntalo su un target di tua proprietà.

brew install joloooo/swarm/swarm
Sorgente su GitHub