Le skill smettono di aiutare sui modelli più capaci

Design dell'agenteDal team SwarmAttacker di JolocorpPubblicato 7 min di lettura

Calabrone robotico nero che perde ali extra che si dissolvono in particelle rosse: skill esperte che svaniscono sui modelli più nuovi

SwarmAttacker viene fornito con oltre 60 skill esperte scritte a mano, una per classe di vulnerabilità. SQL injection, XSS, SSRF, IDOR e tutte le altre ricevono ciascuna un playbook in testo semplice: ecco come funziona questa classe, ecco come la trasformi in un risultato reale. A runtime iniettiamo la skill corrispondente direttamente nel worker che sta inseguendo quella pista. È il genere di cosa che tutti ti dicono di costruire. La conoscenza esperta curata, dice la saggezza convenzionale, è la grande vittoria.

Così l'abbiamo misurata nell'unico modo onesto: abbiamo spento ogni skill e rieseguito l'intera suite di 104 app. Il risultato è stato più interessante di "le skill fanno bene".

Cosa è costato davvero spegnere tutte le skill?

Con tutte le skill disabilitate, il tasso di risoluzione è sceso dal 94% (98 su 104) all'87% (90 su 104). Otto benchmark persi. Reale, ma non il crollo che ti aspetteresti strappando via 60 playbook esperti.

E il costo è andato nella direzione opposta, e di molto. Il worker senza skill ha usato meno della metà dei token: da 2.14M per app a 0,91M. È stata la singola variazione di costo più grande di qualsiasi componente testato. Tutta quella competenza iniettata non era gratis; era la cosa più costosa nel prompt, e toglierla ha reso l'agente drasticamente più snello.

Sistema completo vs. senza skill

Spegnere tutte le 60 skill è costato otto benchmark ma ha più che dimezzato la spesa in token.

94%
sistema completo
87%
senza skill
−8
benchmark persi
2.14M → 0.91M
token per app

Per i primi 20 minuti, l'agente senza skill era in vantaggio

Ecco la sorpresa. Al ventesimo minuto, la configurazione senza skill aveva risolto più del sistema completo: 79 contro 71. Per l'intero primo atto di ogni esecuzione, le skill erano peso morto. Il worker generico e snello era, se mai, più veloce in partenza. Le skill hanno recuperato il vantaggio solo nella seconda metà, finendo 90 a 98.

Risolti al ventesimo minuto

Per tutto il primo atto, il worker senza skill era in vantaggio. Il vantaggio si è invertito solo a esecuzione avanzata.

Senza skill
79
Sistema completo
71

Quando abbiamo guardato dove erano andati persi gli otto benchmark, lo schema era pulito. La discovery è sopravvissuta bene senza skill. Il worker trovava comunque il punto di iniezione, otteneva comunque il suo appiglio. Quello che mancava era l'ultimo passo, specifico per classe: trasformare un appiglio funzionante nel flag vero e proprio sui bersagli più difficili e vincolati a convenzioni, dove devi conoscere l'unico trucco esatto che quella particolare classe richiede. Le skill oggi sono uno strumento per la coda difficile, non un moltiplicatore di base.

Perché le skill rendono meno su un modello più intelligente

Fai un passo indietro e ha senso. Un modello base moderno conosce già le cose comuni. Non devi spiegare a GPT-5.5 cos'è XSS, o come funziona una SQL injection basata su UNION. Ha letto tutto internet, compreso ogni tutorial, ogni writeup, ogni postmortem di CTF che avremmo parafrasato in una skill. L'impalcatura esperta che era una spinta enorme sui modelli più vecchi è stata silenziosamente assorbita nei pesi.

Qui non possiamo fare un A/B tra due generazioni di modelli, quindi non fingeremo di aver misurato "le skill hanno aiutato GPT-4 di X e GPT-5.5 di Y". Non l'abbiamo fatto. Ma la forma del risultato, il modello base che passa i casi facili e medi completamente da solo, è esattamente ciò che ti aspetteresti se il modello avesse già assorbito la maggior parte di ciò che le skill aggiungevano. Su un modello di frontiera, le skill si guadagnano il posto solo ai margini.

La conoscenza esperta che due anni fa avresti scritto a mano in una skill è già nel modello. Sui casi comuni, stai pagando token per dirgli cose che sa.

Cosa significa se stai costruendo

Non versare mesi in una gigantesca libreria di skill o RAG per un modello di frontiera. L'istinto di caricare in anticipo ogni briciola di competenza di dominio aveva senso quando il modello base era più debole; oggi ti compra soprattutto una spesa in token più grande e un primo atto più lento. Invece:

  • Lascia che il modello base gestisca i casi comuni. Lo farà, e lo farà più in fretta senza la tua impalcatura tra i piedi.
  • Tieni le skill snelle e mirate alla coda lunga, i casi limite vincolati a convenzioni dove il trucco esatto conta e il modello altrimenti si fermerebbe a un passo dalla meta.
  • Tieni d'occhio il costo in token della tua competenza. La conoscenza iniettata è la cosa più costosa in un prompt. Se non muove il tasso di risoluzione, è puro overhead.

È la stessa storia che abbiamo visto svolgersi altrove: il modello continua ad assorbire l'impalcatura che gli costruiamo attorno. L'abbiamo visto anche con il prompt engineering, dove le regole accurate che avevamo scritto si sono rivelate cose che un modello forte fa già da solo. Le skill sono il prossimo strato a diventare sottile. Costruisci per i margini, non per il centro.