Sind Prompts tot?

Prompt EngineeringVom SwarmAttacker-Team bei JolocorpVeröffentlicht 7 Min Lesezeit

Schwarze Roboter-Hornisse entfernt sich von einer roten Wand aus Prompt-Text, die in Partikel zerfällt: sind Prompts tot

Vor gar nicht langer Zeit war Prompt Engineering die halbe Miete. Du hast ein Modell mit Chain-of-Thought verführt, es mit ein paar Beispielen angefüttert, einen sorgfältigen System-Prompt voller Regeln und Checklisten geschrieben, und dieses Gerüst war der Unterschied zwischen einem nützlichen und einem nutzlosen Agenten. Als wir SwarmAttacker gebaut haben, haben wir das alles also auch gemacht.

Dann haben wir es komplett abgeschaltet, um zu sehen, was es tatsächlich wert war. Die Antwort, auf einem aktuellen Frontier-Modell, lautete: fast nichts.

Das Experiment: jede Prompting-Technik abgeschaltet

SwarmAttacker löst Sicherheitsaufgaben: Man setzt es auf eine verwundbare Web-App an, und es muss die Flag finden. Wir lassen es gegen eine Suite aus 104 davon laufen. Das vollständige System löst auf GPT-5.5 94%.

Um zu messen, was jeder Teil beiträgt, haben wir Komponenten einzeln deaktiviert und die ganze Suite erneut laufen lassen. Eine dieser Komponenten war jede handgeschriebene Prompting-Technik im Agenten: die Regeln, die ihm sagen, vielfältige Ansätze zu probieren, statt sich in einen einzigen zu verrennen, die Checkliste, die vor voreiligen Schlüssen schützt, die Notizen zum Run-Zustand, die ihn anstupsen, wenn er feststeckt. Alles davon, aus.

Verlorene Benchmarks beim Entfernen einer Komponente

Jeder Teil von SwarmAttacker, einzeln deaktiviert, gemessen am vollständigen 94%-System. Prompt Engineering ist der kleinste Balken auf dem Board.

Umgang mit VerweigerungenHält das Modell überhaupt am Antworten
22
SkillsDer letzte klassenspezifische Schritt zur Flag
8
WebsucheWissensabfragen bei Bedarf
6
PlumbingStrukturierte Findings + Steuerung
5
Prompting-TechnikenHandgeschriebene Prompt-Disziplin
3

Das Entfernen jeder Prompting-Technik kostete drei Benchmarks. Drei, von 104. Es war der kleinste Abfall von allem, was wir getestet haben, um den Faktor sieben kleiner als das Refusal-Handling, und es sparte nicht einmal Geld: Der Run verbrauchte ohne das Gerüst im Grunde gleich viele Tokens.

94%
vollständiges System
91%
ohne Prompting-Techniken
−3
verlorene Benchmarks

Ohne Prompting-Techniken war der Run zwanzig Minuten lang vorn

Hier kommt der Teil, der wehtat. In den ersten zwanzig Minuten jedes Runs löste die Version ohne Prompting-Techniken mehr Benchmarks als das vollständige System, 76 zu 71. Das sorgfältige Gerüst half früh nicht nur nicht; es bremste den Agenten aus. Die drei Benchmarks, die es am Ende doch rettete, tauchten erst spät auf, bei den schwersten Zielen.

Der Grund ist kein Rätsel. Die Standards, die wir in den Prompt geschrieben haben, probiere mehr als eine Sache, vertraue keinem einzelnen Signal, prüfe deine Annahmen, sind Dinge, die ein starkes Modell heute größtenteils von selbst tut. Wir haben Regeln geschrieben, um Verhalten zu erzwingen, das das Modell längst gelernt hatte.

Eine Fähigkeit, die ältere Agenten in den Prompt hineinbauen mussten, ist vom Basismodell stillschweigend übernommen worden.

Sind Prompts also tot?

Nein. Aber der Schwerpunkt hat sich verschoben. Drei Benchmarks sind nicht null, und bei den schwersten, konventionslastigsten Zielen verdiente sich das Gerüst seinen Platz weiterhin. Wenn du ein kleineres oder älteres Modell betreibst, zählt Prompt-Disziplin weit mehr als das, weil das Modell die Lücken noch nicht für dich füllt.

Tot ist die Vorstellung, dass cleveres Prompting der Hebel ist. Auf einem Frontier-Modell ist es eine der unwichtigsten Sachen, in die du Aufwand stecken kannst. Die Gewinne kommen jetzt aus dem, was das Modell umgibt: ihm die richtigen Tools geben, Tool-Output sauber zurückspielen, es vor Verweigerung bewahren und es erneut versuchen lassen. Das sind die Teile, die, als wir sie entfernten, tatsächlich wehtaten.

Wenn du deine Nachmittage immer noch damit verbringst, einen System-Prompt auf Modellen der GPT-5-Klasse von Hand zu tunen, legen die Daten nahe, dass du den einen Hebel polierst, der sich kaum bewegt. Der größere ist, seltsamerweise, einfach das Modell noch einmal probieren zu lassen.