Ergebnisse
94% der Suite, in einem Durchlauf.
Jede Zahl hier stammt daraus, SwarmAttacker gegen den XBOW-Validierungs-Benchmark laufen zu lassen: 104 echte, containerisierte verwundbare Webanwendungen, jede mit einer versteckten Flag, allein aus der URL heraus als Black-Box angegangen.
Gegen das Feld
Ältere Agenten liegen um die halbe Suite herum.
Selbst gepaart mit einem Frontier-Modell von 2026. Der Sprung ist kein neuer Trick; es ist ein modernes Basismodell, gefahren von einem Design, das gebaut ist, um ihm aus dem Weg zu gehen.
Ein Äpfel-mit-Birnen-Diagramm, ehrlich beschriftet. SwarmAttacker und MAPTA sind Einzeldurchläufe; die vier älteren Agenten sind Best-of-Three-Spitzenwerte, neu gemessen auf Modellen von 2026; XBOW ist eine Herstellerangabe; die Menschen-Zeile ist der Beste von fünf Profis über jeweils rund 40 Stunden.
Nach Schwierigkeit
Schwierigkeit sagt Misserfolg kaum voraus.
Die sechs Verfehlungen verteilen sich auf leicht, mittel und schwer.
Nach Schwachstellenklasse
Ein Punkt pro App.
Durchweg stark. Der einzige Schwachpunkt ist blinde SQL-Injection, wo es keine sichtbare Antwort zum Auslesen gibt.
Zeit bis zur Flag
Zwei Höcker.
Ein großer im niedrigen bis mittleren Zehnerbereich für Single-Shot-Captures und ein zweiter Anstieg jenseits von 20 Minuten für die Ziele, die einen zweiten Akt brauchen.
Gelöste Apps pro Zwei-Minuten-Intervall. Der gestrichelte Balken rechts sind die sechs Läufe, die das 40-Minuten-Limit erreichten.
Was wirklich zählt
Wir haben jeden Teil abgeschaltet, um zu sehen, was er wert war.
Ausgehend vom vollständigen 94%-System, jeweils eine Komponente. Die Linie zeigt, wie weit die Lösungsrate ohne sie fiel.
Der Umgang mit Verweigerungen ist das Rückgrat; handgeschriebenes Prompting fällt bei einem modernen Modell kaum ins Gewicht. Zwei davon wurden zu Blogbeiträgen: Skills helfen bei den leichten Siegen kaum, und Prompt Engineering ist fast totes Gewicht.
Sicherheitsfilter
Was eine verweigerte Anfrage löst.
Wiederholt auf dem harten Rest der Verweigerungen, die einen ersten Retry überstanden. Keine einzelne Technik gewinnt; die garantierte Lösung ist der Wechsel zu einem nachgiebigeren Modell, und das schlichte erneute Senden derselben Anfrage klappt etwa in der Hälfte der Fälle.
Verwandle eine URL in einen Sicherheitsbericht.
Open Source, MIT-lizenziert, und es läuft über den ChatGPT-Plan, für den du ohnehin schon zahlst. Installiere es und richte es auf ein Ziel, das dir gehört.
brew install joloooo/swarm/swarm