Vieux agents, nouveaux modèles : toujours la moitié

BenchmarksPar l'équipe SwarmAttacker chez JolocorpPublié 7 min de lecture

Frelon robotique noir devançant quatre frelons plus anciens et effacés le long d'une ligne laser rouge : vieux agents, nouveaux modèles

Voici un fait qui devrait paraître étrange. Les agents de test d'intrusion construits en 2023 et 2024 ont été écrits pour GPT-4, à l'époque où GPT-4 était le meilleur cerveau que l'argent pouvait acheter. Ces mêmes agents peuvent tourner aujourd'hui sur un modèle frontière de 2026, la même classe de modèle que celle qu'utilise SwarmAttacker. Personne n'a besoin de réécrire une ligne de code pour cela. Il suffit de pointer l'ancien harnais vers la nouvelle API.

Alors, quand on le fait, quand on donne aux anciens agents le cerveau le plus intelligent disponible, jusqu'où vont-ils ? À peu près la moitié du benchmark. Toujours.

Les anciens agents de pentest, remesurés sur les nouveaux modèles

Nous faisons tourner chaque système contre la même suite d'applications web vulnérables : on le pointe vers une cible, il doit trouver le flag. Remesurés sur les modèles frontière actuels, les anciens agents se regroupent dans une fourchette serrée :

  • AutoPT résout 51 %.
  • PentestGPT résout 54 %.
  • VulnBot résout 58 %.
  • PentestAgent résout 61 %.

SwarmAttacker résout 94 %. Et voici le détail qui compte pour un combat équitable : ces anciens chiffres sont des pics sur trois essais. Nous avons lancé chacun d'eux trois fois et gardé leur meilleur score. Les 94 % de SwarmAttacker sont une passe unique, une seule tentative, sans relance au niveau supérieur. S'il y a un biais, l'écart dans le graphique ci-dessous est dessiné trop gentiment pour l'ancienne garde.

Même classe de modèle, résultats très différents

Anciens agents remesurés sur des modèles frontière de 2026 (pics sur trois essais) contre SwarmAttacker (une passe unique sur GPT-5.5). Tout le monde a accès au même cerveau ; les résultats ne sont pas proches.

AutoPTpic au meilleur des 3
51%
PentestGPTpic au meilleur des 3
54%
VulnBotpic au meilleur des 3
58%
PentestAgentpic au meilleur des 3
61%
MAPTApasse unique, GPT-5
77%
Expert humain (meilleur des 5)~40 heures, manuel
85%
XBOWautodéclaratif de l'éditeur
85%
PentestGPT v2 (Excalibur)pic au meilleur des 3, Opus 4.5
91%
SwarmAttackerpasse unique, GPT-5.5
94%
~55 %
anciens agents, meilleur de trois essais
94 %
SwarmAttacker, passe unique

Si le modèle est le même, qu'est-ce qui change ?

C'est tout l'enjeu. Tout le monde dispose d'un modèle frontière aujourd'hui. C'est une commodité, à une clé d'API de distance. Si la capacité brute du modèle était ce qui résout ces cibles, les anciens agents auraient dû bondir dès qu'on les a repointés vers un modèle de 2026. Ce n'est pas arrivé. Ils ont bougé un peu, puis ils ont heurté le même plafond qu'ils heurtent toujours.

La raison est qu'un modèle intelligent n'est pas la même chose qu'une cible résolue. Entre les deux se trouve le harnais : tout ce qui entoure le modèle et transforme ses suppositions brutes en travail fini. C'est là que SwarmAttacker concentre ses efforts, et c'est exactement la partie que les anciens agents n'ont jamais construite :

  • Un swarm, pas un soliste. Au lieu d'un seul agent qui raisonne sur une cible étape par étape, SwarmAttacker déploie des workers parallèles qui sondent plusieurs pistes à la fois, si bien qu'une impasse sur un chemin ne bloque pas toute l'exécution.
  • La gestion des refus. Les modèles frontière refusent régulièrement le travail de sécurité, même pleinement autorisé. Un agent qui prend le premier refus pour un non s'arrête tout simplement. S'en remettre vaut plus que n'importe quelle astuce de prompt.
  • Des découvertes structurées. Ce qu'un worker découvre est consigné sous une forme propre et partagée sur laquelle le reste de l'exécution peut s'appuyer, au lieu de se dissoudre dans un mur d'historique de conversation.
  • Une boucle qui s'observe elle-même. L'agent regarde ce que chaque action a réellement produit, remarque quand il est bloqué et replanifie au lieu de s'enfoncer dans une mauvaise idée.
Le modèle est le moteur. Le harnais est la voiture. Mettre un meilleur moteur dans une voiture sans roues ne la rend pas plus rapide.

La seule exception, PentestGPT v2, a reconstruit son harnais

Il existe une exception moderne, et il est important d'être honnête à son sujet. PentestGPT v2, nom de code Excalibur, atteint 91 % à son pic sur trois essais en tournant sur Claude Opus 4.5. C'est un résultat réellement solide, tout près du sommet du tableau.

Mais regardez pourquoi il est là-haut. Excalibur n'est pas simplement l'ancien PentestGPT avec une nouvelle clé d'API ; c'est un agent reconstruit, avec un harnais reconstruit autour du modèle. Ce qui est exactement l'argument, pris dans l'autre sens. Quand quelqu'un retravaille l'architecture, le chiffre bouge. Quand quelqu'un se contente de remplacer le modèle sous une ancienne architecture, il ne bouge pas. Le seul agent qui a comblé l'écart l'a fait en changeant la chose dont ce billet dit qu'elle compte.

La leçon pour quiconque construit l'un de ces agents

Il est tentant, à chaque sortie d'un nouveau modèle, de supposer que votre agent vient de s'améliorer gratuitement. Parfois c'est le cas, un peu. Mais le plafond que vous continuez de heurter n'est presque plus jamais le modèle ; c'est l'échafaudage que vous avez monté autour de lui il y a un an et jamais revisité. Les anciens agents de pentest en sont la démonstration en direct : le même cerveau que tout le monde, toujours coincés à la moitié.

Si vous voulez du levier, investissez-le dans le harnais, dans l'orchestration, la récupération, la mémoire, la boucle, pas dans l'attente du prochain modèle. C'est la thèse derrière SwarmAttacker, et c'est pourquoi c'est l'agent, pas le modèle, que nous ne cessons de pointer du doigt. Vous pouvez voir le détail complet de ce que SwarmAttacker a réellement résolu sur la page des résultats.