Es ist nicht das Modell, Kumpel. Es ist der Agent.

Agenten-DesignVom SwarmAttacker-Team bei JolocorpVeröffentlicht 8 Min Lesezeit

Drei schwarze Roboter-Hornissen mit roten Augen nach vorn gerichtet auf einem roten Gitter: der Agent, nicht das Modell

Es gibt eine Zeile in Top Gun, die sich jeder Engineer an den Monitor kleben sollte. Maverick wird gesagt, sein Jet sei unterlegen, und er sagt, das spiele keine Rolle: it's not the plane, it's the pilot. Tausch zwei Wörter aus, und du hast die wichtigste und meistignorierte Tatsache über das Bauen mit Sprachmodellen. Es ist nicht das Modell. Es ist der Agent.

Wir können es mit SwarmAttacker beweisen, weil wir uns zuerst selbst blamiert haben.

Gleiches Modell, halber Score

Als wir SwarmAttacker zum ersten Mal auf den Benchmark ansetzten, ließen wir GPT-5.5 mit seinem höchsten Reasoning-Effort laufen. Mehr Nachdenken, besseres Hacken, klar. Es schaffte kaum die Hälfte der Ziele. Wir waren bereit, der Aufgabe die Schuld zu geben oder auf ein größeres Modell zu warten.

Dann änderten wir nichts am Modell und alles am Agenten drumherum. Wir drehten den Reasoning-Effort auf medium herunter, strafften die Schleife, reparierten, wie Funde zurückkamen, und ließen es mehr, billigere Blicke auf das Ziel werfen. Dasselbe GPT-5.5, exakt dieselben Gewichte, ging auf 94%.

Ein Modell, zwei Agenten

Identisches Modell und identische Gewichte (GPT-5.5). Das Einzige, was sich zwischen diesen beiden Balken änderte, ist der Agent, der darum herumgebaut ist.

Erster BuildGPT-5.5, höchster Effort
50%
Nach dem TuningGPT-5.5, mittlerer Effort
94%
~50%
erster Build
94%
nach dem Tuning
0
Modelländerungen

Warum schnitt mehr Nachdenken schlechter ab?

Der kontraintuitive Teil ist, dass es schlechter wurde, den Reasoning-Effort hochzudrehen. Auf Maximum gedreht, kaute das Modell auf jedem einzelnen Zug herum, produzierte wunderschönes, sorgfältiges, langsames Denken und verbrannte dabei die Uhr. Innerhalb eines festen Zeitbudgets kaufte das weit weniger vollständige Zyklen aus Schauen, Handeln und Neuplanen.

Bei mittlerem Effort bewegte es sich schneller und schaute öfter. Es probierte eine billige Sonde, las, was zurückkam, und korrigierte, während die Hoch-Effort-Version noch über ihre erste Idee beriet. Unser ganzes Design will viele kleine schnelle Zyklen, nicht ein paar tiefe, also arbeitete die Einstellung, die klüger klingt, aktiv gegen die Architektur. Dieser Rhythmus, geduldige Breite statt tiefer Einzelzüge, ist derselbe, den wir in wie es funktioniert beschreiben.

Das Modell setzt die Obergrenze. Der Agent entscheidet, wie viel von dieser Obergrenze du tatsächlich erreichst.

Was den Score eines Agenten wirklich bewegt

Sobald du den 44-Punkte-Schwung erkennst, was er ist, lautet die Frage nicht mehr „welches Modell“, sondern „wie wird es gesteuert“. Die Hebel, die SwarmAttackers Ergebnisse entschieden, lagen fast alle auf der Agentenseite:

  • Reasoning-Effort-Tuning, abgestimmt auf ein Zeitbudget, nicht reflexartig aufs Maximum gedreht.
  • Die Schleife und ihr Takt: wie oft sie innehält, um zu beobachten und neu zu planen, statt sich auf eine Linie festzulegen.
  • Nicht verweigert zu werden, der größte einzelne Beitrag jeder Komponente, die wir gemessen haben.
  • Feedback, das nicht lügt: strukturierte Funde, denen der Planner vertrauen kann, statt einer Wand aus rohem Output.
  • Retries, weil das Modell nichtdeterministisch ist und ein zweiter Versuch oft umsonst ist.

Nichts davon ist das Modell. Und du kannst dieselbe Geschichte von außen nach innen sehen: Ältere Agenten, denen man ein Frontier-Modell von 2026 gibt, lösen immer noch nur etwa die Hälfte der Suite, weil ein besseres Gehirn in einem schlechteren Harness immer noch ein schlechteres Ergebnis ist. An dem Faden haben wir in alte Pentest-Agenten auf neuen Modellen lösen immer noch nur die Hälfte gezogen.

Hör auf, auf das nächste Modell zu warten

Das nächste Modell kommt immer, und es wird die Obergrenze für alle um den gleichen Betrag anheben. Der billigere, größere Gewinn sitzt fast immer in dem Agenten, den du schon hast: die Effort-Einstellung, die du nie getunt hast, die Schleife, die sich zu früh festlegt, die Verweigerungen, die du schweigend hinnimmst. Wir haben unseren Score verdoppelt, ohne das Modell anzufassen. Es ist nicht das Modell, Kumpel. Es ist der Agent.