Czy prompty są martwe?

Prompt engineeringZespół SwarmAttacker w JolocorpOpublikowano 7 min czytania

Czarny robotyczny szerszeń odchodzący od czerwonej ściany tekstu promptów rozpadającej się w cząstki: czy prompty są martwe

Nie tak dawno inżynieria promptów była połową roboty. Podprowadzałeś model łańcuchem myśli, zasiewałeś go kilkoma przykładami, pisałeś staranny prompt systemowy pełen reguł i list kontrolnych, a to rusztowanie było różnicą między użytecznym a bezużytecznym agentem. Kiedy więc budowaliśmy SwarmAttacker, my też to wszystko robiliśmy.

Potem wyłączyliśmy to wszystko, żeby zobaczyć, ile tak naprawdę było warte. Odpowiedź, na obecnym topowym modelu, brzmiała: prawie nic.

Eksperyment: każda technika promptowania wyłączona

SwarmAttacker rozwiązuje wyzwania bezpieczeństwa: skieruj go na podatną aplikację webową, a musi znaleźć flagę. Uruchamiamy go na zestawie 104 takich aplikacji. Pełny system, na GPT-5.5, rozwiązuje 94%.

Aby zmierzyć, ile wnosi każda część, wyłączaliśmy komponenty pojedynczo i uruchamialiśmy cały zestaw od nowa. Jednym z tych komponentów była każda ręcznie napisana technika promptowania w agencie: reguły każące mu próbować różnorodnych podejść zamiast drążyć jedno, lista kontrolna strzegąca przed pochopnymi wnioskami, notatki o stanie biegu, które szturchają go, gdy utknie. Wszystko to, wyłączone.

Benchmarki utracone po usunięciu komponentu

Każda część SwarmAttackera, wyłączana pojedynczo, mierzona względem pełnego systemu 94%. Inżynieria promptów to najmniejszy słupek na tablicy.

Obsługa odmówSprawia, że model w ogóle odpowiada
22
SkilleOstatni krok specyficzny dla klasy, prowadzący do flagi
8
Wyszukiwanie w sieciWyszukiwanie wiedzy na żądanie
6
Wewnętrzne mechanizmyUstrukturyzowane ustalenia + sterowanie
5
Techniki promptowaniaRęcznie pisana dyscyplina promptów
3

Usunięcie każdej techniki promptowania kosztowało trzy benchmarki. Trzy, z 104. Był to najmniejszy spadek ze wszystkiego, co testowaliśmy, siedmiokrotnie mniejszy niż przy obsłudze odmów, i nie oszczędził nawet pieniędzy: bieg zużył zasadniczo tyle samo tokenów bez rusztowania.

94%
pełny system
91%
bez technik promptowania
−3
utracone benchmarki

Bez technik promptowania bieg prowadził przez dwadzieścia minut

Oto część, która zabolała. Przez pierwsze dwadzieścia minut każdego biegu wersja bez technik promptowania rozwiązywała więcej benchmarków niż pełny system, 76 do 71. Staranne rusztowanie nie tylko nie pomagało na wczesnym etapie; spowalniało agenta. Trzy benchmarki, które ostatecznie uratowało, pojawiły się dopiero późno, na najtrudniejszych celach.

Powód nie jest tajemniczy. Standardy, które wpisaliśmy w prompt, próbuj więcej niż jednej rzeczy, nie ufaj pojedynczemu sygnałowi, sprawdzaj swoje założenia, to rzeczy, które silny model teraz w większości robi sam. Pisaliśmy reguły, by wymusić zachowanie, którego model już się nauczył.

Zdolność, którą starsi agenci musieli wpisywać w prompt, została po cichu wchłonięta przez model bazowy.

Czy prompty są więc martwe?

Nie. Ale środek ciężkości się przesunął. Trzy benchmarki to nie zero, a na najtrudniejszych, najbardziej związanych konwencją celach rusztowanie wciąż zasłużyło na swoje miejsce. Jeśli uruchamiasz mniejszy lub starszy model, dyscyplina promptu liczy się znacznie bardziej niż tu, bo model jeszcze nie wypełnia luk za ciebie.

Martwe jest przekonanie, że sprytne promptowanie to miejsce, gdzie leży dźwignia. Na topowym modelu to jedna z najmniej ważnych rzeczy, na które możesz poświęcić wysiłek. Wygrane biorą się teraz z tego, co otacza model: z dania mu właściwych narzędzi, czystego zwracania wyjścia narzędzi, chronienia go przed odmową i pozwalania mu na ponowną próbę. To te części, które, gdy je usunęliśmy, naprawdę zabolały.

Jeśli wciąż spędzasz popołudnia na ręcznym strojeniu promptu systemowego na modelach klasy GPT-5, dane sugerują, że polerujesz jedyną dźwignię, która ledwie drga. Większa, o dziwo, to po prostu pozwolenie modelowi na kolejną próbę.