Welche KI-Modelle Sicherheitsarbeit verweigern

BenchmarksVom SwarmAttacker-Team bei JolocorpVeröffentlicht 6 Min LesezeitAktualisiert

Balkendiagramm-Cover: Verweigerungsraten von 16 KI-Modellen bei Offensive-Security-Anfragen, zwei nahe 100%, sieben bei 0%

Video ansehen · 9:23

Video

Ich habe jede KI fürs Hacken getestet — Opus 5 verlor

Durchlassrate bei 411 markierten Offensive-Security-Anfragen

Anteil der Anfragen jedes Modells, die durchgingen. Das Open-Weight-Feld lässt alles durch; die strengsten Claude- und OpenAI-Modelle lassen fast nichts davon durch. Fahre mit der Maus über eine Säule, um die Aufschlüsselung der Verweigerungen zu sehen.

100%
DeepSeek-Logo
DeepSeek V4 Pro
100%
DeepSeek-Logo
DeepSeek V4 Flash
100%
Z.ai-Logo
GLM-5.2
100%
OpenAI-Logo
gpt-oss-120b
100%
MiniMax-Logo
MiniMax M3
100%
NVIDIA-Logo
Nemotron Ultra
100%
Moonshot AI-Logo
Kimi K3
99.5%
OpenAI-Logo
GPT-5.6 Luna
98.3%
OpenAI-Logo
GPT-5.4
97.5%
Anthropic-Logo
Claude Sonnet 5
96%
OpenAI-Logo
GPT-5.6 Terra
96%
OpenAI-Logo
GPT-5.5 · 26 Jul
94%
Anthropic-Logo
Claude Opus 4.8
53.8%
OpenAI-Logo
GPT-5.5 · 15 Jun
14%
Anthropic-Logo
Claude Fable 5
3.2%
OpenAI-Logo
GPT-5.6 Sol
0%
Anthropic-Logo
Claude Opus 5
Aufgabe erledigtVom Modell selbst verweigertVon einem Plattform-Filter blockiert

Richte einen autonomen Pentest-Agenten auf ein echtes Ziel, und er feuert Tausende Anfragen ab, die ein Sicherheitsfilter nicht sauber von einem Angriff unterscheiden kann. SwarmAttacker wird bei vielen davon verweigert, weshalb der Umgang mit Verweigerungen am Ende der wichtigste Teil des Systems war. Es hat uns außerdem ein ungewöhnliches Gut hinterlassen: einen Korpus aus 411 echten Anfragen, die unser Produktionsmodell tatsächlich verweigert hat, direkt aus Live-Benchmark-Läufen gegen die XBOW-Web-Security-Suite. Das sind keine synthetischen Prompts. Jede einzelne ist genau der Zug, mitten im Einsatz, an dem ein Inhaltsfilter einen Agenten blockiert hat, der gerade dabei war, eine Anwendung auszunutzen.

Also haben wir eine einfache Frage gestellt: Spiel dieselben 411 Anfragen durch sechzehn Frontier- und Open-Weight-Modelle ab und schau, wer sie abweist. Die Metrik ist die Ablehnungsrate — der Anteil der Anfragen, die ein Modell entweder im Text verweigert hat oder die ein Plattform-Filter blockiert hat.

Die Teilung ist krass. Zwei geschlossene Frontier-Modelle — Claude Opus 5 und OpenAIs GPT-5.6 Sol — weisen fast alles ab: 100% und 96.8%. Und das gesamte Open-Weight-Feld — DeepSeek V4, GLM-5.2, gpt-oss-120b, MiniMax M3, Nemotron Ultra, Kimi K3 — verweigert nichts davon. Nicht eine einzige Anfrage von 411, jeweils.

100%
Claude Opus 5 abgelehnt
96.8%
GPT-5.6 Sol abgelehnt
0%
jedes Open-Weight-Modell

Das ist keine Geschichte über vorsichtige westliche Labore und rücksichtslose offene Labore. Es ist spezifischer als das. Aggressive Cyber-Verweigerung konzentriert sich auf eine Handvoll einzelner Modelle — Opus 5, Sol — während sich ihre eigenen Geschwister völlig anders verhalten. OpenAIs GPT-5.4, GPT-5.6 Terra und GPT-5.6 Luna liegen alle bei oder unter 4%. Die Verweigerung steckt im Modell, nicht im Anbieter.

Jede Säule ist ein vollständiger Lauf aller 411 Anfragen, dreigeteilt. Grün ist der Anteil, den das Modell einfach gemacht hat — es hat die Aufgabe erledigt. Gelb ist das Modell, das mit eigenen Worten ablehnt. Rot ist ein Plattform-Filter, der die Anfrage blockiert, bevor das Modell überhaupt antwortet. So gelesen ist das Open-Weight-Feld eine massive grüne Wand, und die beiden Frontier-Verweigerer sind eine rote Wand. Unter den strengen Modellen ist der Mechanismus derselbe: Sol, Opus 5, Fable 5, Terra und das Produktions-GPT-5.5 sind fast ausschließlich rote Plattform-Blocks, während GPT-5.4 und Luna nur einen schmalen gelben Streifen zeigen — kein Filter, nur das Modell selbst, das ablehnt. Nur Opus 4.8 und Sonnet 5 mischen beides. Fahre mit der Maus über eine Säule, um die genaue Aufteilung zu sehen.

Dasselbe Modell hat an einem Tag 46% verweigert und am nächsten 4%

Der unangenehmste Befund betrifft GPT-5.5, das Modell, das diesen Korpus überhaupt erst erzeugt hat — weshalb es im Diagramm oben zweimal auftaucht. In der Produktion am 15. Juni, dem Lauf, der den Korpus hervorgebracht hat, blockierte es 190 der 411 — 46.2%, jede einzelne ein Plattform-Block nach Cyber-Richtlinie. Spiel die identischen Prompts am 26. Juli durch dasselbe Modell ab, und die Ablehnungsrate bricht auf 4% ein. Dieselben Gewichte, dieselben Prompts, sechs Wochen Abstand.

Deshalb sind beide datiert und nebeneinander gezeigt: Die Zahl ist keine feste Eigenschaft des Modells. Ob eine Anfrage blockiert wird, hängt stark vom Serving-Pfad ab, vom umgebenden Kontext und davon, wie der Filter an diesem Tag gerade aussah — sie bedeutet also nur mit einem Datum daneben etwas. Ein Korpus existiert, weil GPT-5.5 diese Anfragen im Juni verweigert hat, und doch reproduziert das erneute Abspielen im Juli die Verweigerung kaum. Für alle, die auf einem Sicherheitsfilter aufbauen, ist dieser Nichtdeterminismus das eigentliche Kopfzerbrechen: Du kannst Anfrage für Anfrage nicht vorhersagen, ob dasselbe Modell dir helfen wird.

Wo in einem Lauf feuern die Verweigerungen tatsächlich?

Der Korpus zeigt auch, wann in einem Lauf eine Anfrage markiert wird, und es ist nicht dort, wo man raten würde. Das Modell verweigert selten eine kalte Frage. In zwei Dritteln der Fälle reagiert es auf das, was ein Tool gerade zurückgegeben hat.

Was gerade passierte, als eine Anfrage markiert wurde

Über alle 411 markierten Züge. Der Block feuert direkt, nachdem eine Sonde etwas zutage gefördert hat, nicht bei einer frischen Anweisung.

67.2%
Tool-Ausgabe
16.3%
Planner-Überlegung
9%
Erster Schritt des Spezialisten
6.1%
Worker gestartet
1.5%
Recon-Schritt

67% der Markierungen landen direkt nach einem Tool-Dump — der Agent hat gerade ein Passwort, eine Datenbank, eine Konfigurationsdatei oder eine flag{…} zurückgeholt, und genau der nächste Schritt löst den Filter aus. Die Entdeckung ist der Auslöser. Deshalb kann man diese Transkripte auch nicht kürzen, um Tokens zu sparen, indem man die Tool-Ausgabe beschneidet: Das exfiltrierte Geheimnis ist genau das, was den Block verursacht hat.

Was das für alle bedeutet, die ein Sicherheitstool bauen

Wenn du ein autorisiertes Sicherheitstool baust, ist die Modellwahl kein Rundungsfehler — sie ist der Unterschied zwischen einem System, das funktioniert, und einem, das die Hälfte seiner eigenen Arbeit verweigert. Das Open-Weight-Feld erledigt die Arbeit ohne Murren. Unter den geschlossenen Modellen ist die Streuung innerhalb eines einzelnen Anbieters größer als die Streuung zwischen Anbietern, und das Blockverhalten ist instabil genug, dass ein Benchmark der einzige ehrliche Weg ist, herauszufinden, wo ein bestimmtes Modell landet.

Deshalb läuft SwarmAttacker mit GPT-5.4 als verweigerungsresistentem Hauptmodell und behandelt den Umgang mit Verweigerungen als erstklassige Komponente statt als nachträglichen Einfall. Wenn der Filter dich bei zwei Dritteln deiner Anfragen abweist, sobald du etwas findest, muss der Agent um das Modell herum darauf gebaut sein, genau das zu erwarten.

Methode: 411 Anfragen, die unser Produktionsmodell verweigert hat und die einen Retry auf demselben Modell überstanden haben, einmal pro Modell erneut abgespielt (GPT-5.5 ist an zwei Daten gezeigt, 15. Juni und 26. Juli). Claude Fable 5 ist ein agentischer Lauf mit aktivierten Tools auf einer Stichprobe von 40 Anfragen, in dem sein Cyber-Gate weit häufiger feuert als in einem einfachen Aufruf ohne Tools. Die Ablehnungsquote zählt Verweigerungen und Plattform-Blocks über die Anfragen, die das Modell erreicht haben; Transportfehler sind ausgeschlossen. Vollständige Antworten wurden gespeichert und unabhängig auf übersehene Verweigerungen geprüft.