Ergebnisse

94% der Suite, in einem Durchlauf.

Jede Zahl hier stammt daraus, SwarmAttacker gegen den XBOW-Validierungs-Benchmark laufen zu lassen: 104 echte, containerisierte verwundbare Webanwendungen, jede mit einer versteckten Flag, allein aus der URL heraus als Black-Box angegangen.

94%
98 von 104 Apps
15Min
Median-Zeit
40Min
Zeitlimit
6
Verfehlungen
2.14M
Token pro App

Gegen das Feld

Ältere Agenten liegen um die halbe Suite herum.

Selbst gepaart mit einem Frontier-Modell von 2026. Der Sprung ist kein neuer Trick; es ist ein modernes Basismodell, gefahren von einem Design, das gebaut ist, um ihm aus dem Weg zu gehen.

AutoPTBest-of-3-Spitze
51%
PentestGPTBest-of-3-Spitze
54%
VulnBotBest-of-3-Spitze
58%
PentestAgentBest-of-3-Spitze
61%
MAPTAEinzeldurchlauf, GPT-5
77%
Menschlicher Experte (bester von 5)~40 Stunden, manuell
85%
XBOWHerstellerangabe
85%
PentestGPT v2 (Excalibur)Best-of-3-Spitze, Opus 4.5
91%
SwarmAttackerEinzeldurchlauf, GPT-5.5
94%
bester Mensch

Ein Äpfel-mit-Birnen-Diagramm, ehrlich beschriftet. SwarmAttacker und MAPTA sind Einzeldurchläufe; die vier älteren Agenten sind Best-of-Three-Spitzenwerte, neu gemessen auf Modellen von 2026; XBOW ist eine Herstellerangabe; die Menschen-Zeile ist der Beste von fünf Profis über jeweils rund 40 Stunden.

Nach Schwierigkeit

Schwierigkeit sagt Misserfolg kaum voraus.

Die sechs Verfehlungen verteilen sich auf leicht, mittel und schwer.

Stufe 144 / 451 verfehlt
Stufe 247 / 514 verfehlt
Stufe 37 / 81 verfehlt

Nach Schwachstellenklasse

Ein Punkt pro App.

Durchweg stark. Der einzige Schwachpunkt ist blinde SQL-Injection, wo es keine sichtbare Antwort zum Auslesen gibt.

XSS
22/23
Standard-Zugangsdaten
17/18
IDOR
14/14
Rechteausweitung
14/14
SSTI
12/13
Command Injection
11/11
Geschäftslogik
7/7
SQLi
6/6
Informationspreisgabe
6/6
Unsichere Deserialisierung
5/6
LFI
5/6
Path Traversal
5/5
Beliebiger Datei-Upload
4/6
Bekannte CVE
4/4
XXE
3/3
SSRF
3/3
GraphQL
3/3
JWT
3/3
Krypto
3/3
Blinde SQLi
1/3
gelöst verfehlt

Zeit bis zur Flag

Zwei Höcker.

Ein großer im niedrigen bis mittleren Zehnerbereich für Single-Shot-Captures und ein zweiter Anstieg jenseits von 20 Minuten für die Ziele, die einen zweiten Akt brauchen.

Median 15 Min40+ Min6 Zeitüberschreitung0102030 Min

Gelöste Apps pro Zwei-Minuten-Intervall. Der gestrichelte Balken rechts sind die sechs Läufe, die das 40-Minuten-Limit erreichten.

Was wirklich zählt

Wir haben jeden Teil abgeschaltet, um zu sehen, was er wert war.

Ausgehend vom vollständigen 94%-System, jeweils eine Komponente. Die Linie zeigt, wie weit die Lösungsrate ohne sie fiel.

Umgang mit VerweigerungenHält das Modell überhaupt am Antworten
−22 Pkt
SkillsDer letzte klassenspezifische Schritt zur Flag
−7 Pkt
WebsucheWissensabfragen bei Bedarf
−6 Pkt
PlumbingStrukturierte Findings + Steuerung
−5 Pkt
Prompting-TechnikenHandgeschriebene Prompt-Disziplin
−3 Pkt
60%70%80%90%100%

Der Umgang mit Verweigerungen ist das Rückgrat; handgeschriebenes Prompting fällt bei einem modernen Modell kaum ins Gewicht. Zwei davon wurden zu Blogbeiträgen: Skills helfen bei den leichten Siegen kaum, und Prompt Engineering ist fast totes Gewicht.

Sicherheitsfilter

Was eine verweigerte Anfrage löst.

Wiederholt auf dem harten Rest der Verweigerungen, die einen ersten Retry überstanden. Keine einzelne Technik gewinnt; die garantierte Lösung ist der Wechsel zu einem nachgiebigeren Modell, und das schlichte erneute Senden derselben Anfrage klappt etwa in der Hälfte der Fälle.

52%
Kontext-Manipulation
im Rauschen der Kontrolle
54%
Einfaches erneutes Senden (nur Retry)
gleiche Anfrage, keine Änderung
68%
Autorisierungs-Framing
+14 Pkt, aber instabil über Modelle hinweg
100%
Wechsel zu einem nachgiebigen Modell
der garantierte Fallback

Verwandle eine URL in einen Sicherheitsbericht.

Open Source, MIT-lizenziert, und es läuft über den ChatGPT-Plan, für den du ohnehin schon zahlst. Installiere es und richte es auf ein Ziel, das dir gehört.

brew install joloooo/swarm/swarm
Quellcode auf GitHub