I prompt sono morti?

Prompt engineeringDal team SwarmAttacker di JolocorpPubblicato 7 min di lettura

Calabrone robotico nero che si allontana da un muro rosso di testo di prompt che si dissolve in particelle: i prompt sono morti

Non molto tempo fa il prompt engineering era metà del lavoro. Convincevi un modello con la chain-of-thought, lo innescavi con qualche esempio, scrivevi un system prompt accurato pieno di regole e checklist, e quell'impalcatura faceva la differenza tra un agente utile e uno inutile. Così, quando abbiamo costruito SwarmAttacker, abbiamo fatto tutto questo anche noi.

Poi abbiamo spento tutto, per vedere quanto valesse davvero. La risposta, su un modello frontier attuale, è stata: quasi niente.

L'esperimento: ogni tecnica di prompting disattivata

SwarmAttacker risolve sfide di sicurezza: lo punti su una web app vulnerabile e deve trovare il flag. Lo eseguiamo contro una suite di 104 app. Il sistema completo, su GPT-5.5, ne risolve il 94%.

Per misurare il contributo di ogni parte abbiamo disattivato i componenti uno alla volta e rieseguito l'intera suite. Uno di quei componenti era l'insieme di tutte le tecniche di prompting scritte a mano nell'agente: le regole che gli dicono di provare approcci diversi invece di fissarsi su uno solo, la checklist che lo protegge dal saltare alle conclusioni, le note sullo stato dell'esecuzione che lo spingono quando si blocca. Tutto quanto, spento.

Benchmark persi quando si rimuove un componente

Ogni parte di SwarmAttacker, disattivata una alla volta, misurata rispetto al sistema completo al 94%. Il prompt engineering è la barra più piccola del tabellone.

Gestione dei rifiutiFa sì che il modello continui a rispondere
22
SkillL'ultimo passo specifico per classe verso il flag
8
Ricerca webRicerche di conoscenza su richiesta
6
PlumbingRisultati strutturati + steering
5
Tecniche di promptingDisciplina di prompt scritta a mano
3

Rimuovere ogni tecnica di prompting è costato tre benchmark. Tre, su 104. È stato il calo più piccolo di tutto ciò che abbiamo testato, sette volte più piccolo della gestione dei rifiuti, e non ha nemmeno fatto risparmiare: l'esecuzione ha usato essenzialmente lo stesso numero di token senza l'impalcatura.

94%
sistema completo
91%
senza tecniche di prompting
−3
benchmark persi

Senza tecniche di prompting, l'esecuzione era in vantaggio per venti minuti

Ecco la parte che ha fatto male. Nei primi venti minuti di ogni esecuzione, la versione senza tecniche di prompting risolveva più benchmark del sistema completo, 76 contro 71. L'impalcatura accurata non solo non ha aiutato nella fase iniziale: ha rallentato l'agente. I tre benchmark che alla fine ha recuperato sono arrivati solo tardi, sui target più difficili.

Il motivo non è misterioso. Gli standard che avevamo scritto nel prompt, prova più di una cosa, non fidarti di un singolo segnale, verifica le tue ipotesi, sono cose che un modello forte ormai fa in gran parte da solo. Stavamo scrivendo regole per imporre un comportamento che il modello aveva già imparato.

Una capacità che gli agenti più vecchi dovevano ingegnerizzare nel prompt è stata silenziosamente assorbita dal modello di base.

Quindi i prompt sono morti?

No. Ma il baricentro si è spostato. Tre benchmark non sono zero, e sui target più difficili e più legati alle convenzioni l'impalcatura si è ancora guadagnata il suo posto. Se usi un modello più piccolo o più vecchio, la disciplina del prompt conta molto più di così, perché il modello non sta ancora colmando le lacune al posto tuo.

Ciò che è morto è l'idea che il prompting ingegnoso sia dove sta la leva. Su un modello frontier è una delle cose meno importanti su cui spendere energie. Le vittorie ora arrivano da ciò che circonda il modello: dargli gli strumenti giusti, restituirgli l'output degli strumenti in modo pulito, evitare che venga rifiutato e lasciarlo riprovare. Sono quelle le parti che, quando le abbiamo rimosse, hanno fatto davvero male.

Se passi ancora i pomeriggi a rifinire a mano un system prompt su modelli di classe GPT-5, i dati suggeriscono che stai lucidando l'unica leva che si muove appena. Quella più grande, stranamente, è semplicemente lasciare che il modello riprovi.