Ce n'est pas le modèle, mon ami. C'est l'agent.

Conception d'agentPar l'équipe SwarmAttacker chez JolocorpPublié 8 min de lecture

Trois frelons robotiques noirs aux yeux rouges tournés vers l'avant sur une grille rouge : l'agent, pas le modèle

Il y a une réplique dans Top Gun que chaque ingénieur devrait scotcher sur son écran. On dit à Maverick que son avion est surclassé, et il répond que cela n'a pas d'importance : ce n'est pas l'avion, c'est le pilote. Changez deux mots et vous avez le fait le plus important et le plus ignoré sur la construction avec des modèles de langage. Ce n'est pas le modèle. C'est l'agent.

Nous pouvons le prouver avec SwarmAttacker, parce que nous nous sommes d'abord ridiculisés.

Même modèle, moitié du score

Quand nous avons pointé SwarmAttacker sur le benchmark pour la première fois, nous avons fait tourner GPT-5.5 à son effort de raisonnement le plus élevé. Plus de réflexion, meilleur hacking, évidemment. Il a à peine dépassé la moitié des cibles. Nous étions prêts à accuser la tâche, ou à attendre un modèle plus gros.

Puis nous n'avons rien changé au modèle et tout changé à l'agent autour de lui. Nous avons baissé l'effort de raisonnement à moyen, resserré la boucle, corrigé la façon dont les découvertes remontaient, et l'avons laissé jeter davantage de regards, moins coûteux, sur la cible. Le même GPT-5.5, exactement les mêmes poids, est passé à 94 %.

Un modèle, deux agents

Modèle et poids identiques (GPT-5.5). La seule chose qui change entre ces deux barres est l'agent qui l'entoure.

Première versionGPT-5.5, effort maximal
50%
Après réglageGPT-5.5, effort moyen
94%
~50 %
première version
94 %
après réglage
0
changement de modèle

Pourquoi plus de réflexion a-t-elle donné un score plus bas ?

La partie contre-intuitive, c'est que monter l'effort de raisonnement a empiré les choses. Poussé au maximum, le modèle ruminait chaque mouvement, produisant un raisonnement magnifique, soigné, lent, et brûlait l'horloge ce faisant. Dans un budget de temps fixe, cela achetait bien moins de cycles complets de regarder, agir et replanifier.

À effort moyen, il avançait plus vite et regardait plus souvent. Il essayait une sonde bon marché, lisait ce qui revenait et corrigeait, là où la version à effort élevé délibérait encore sur sa première idée. Toute notre conception veut beaucoup de petits cycles rapides, pas quelques cycles profonds, si bien que le réglage qui paraît plus intelligent combattait activement l'architecture. Ce rythme, l'ampleur patiente plutôt que les coups uniques profonds, est le même que celui que nous décrivons dans comment ça marche.

Le modèle fixe le plafond. L'agent décide quelle part de ce plafond vous atteignez réellement.

Ce qui fait vraiment bouger le score d'un agent

Une fois qu'on voit l'écart de 44 points pour ce qu'il est, la question cesse d'être « quel modèle » et devient « comment est-il piloté ». Les leviers qui ont décidé des résultats de SwarmAttacker étaient presque tous côté agent :

  • Le réglage de l'effort de raisonnement, adapté à un budget de temps, pas poussé au maximum par réflexe.
  • La boucle et sa cadence : à quelle fréquence il s'arrête pour observer et replanifier au lieu de s'engager sur une seule ligne.
  • Ne pas se faire refuser, le plus gros contributeur de tous les composants que nous avons mesurés.
  • Un retour qui ne ment pas : des découvertes structurées auxquelles le planner peut se fier plutôt qu'un mur de sortie brute.
  • Les nouvelles tentatives, parce que le modèle est non déterministe et qu'un second essai est souvent gratuit.

Rien de tout cela n'est le modèle. Et on voit la même histoire de l'extérieur : des agents plus anciens auxquels on confie un modèle frontière de 2026 ne résolvent toujours qu'environ la moitié de la suite, parce qu'un meilleur cerveau dans un moins bon harnais reste un moins bon résultat. Nous avons tiré ce fil dans les anciens agents de pentest sur les nouveaux modèles ne résolvent toujours que la moitié.

Arrêtez d'attendre le prochain modèle

Le prochain modèle arrive toujours, et il relèvera le plafond de tout le monde de la même hauteur. Le gain moins cher et plus grand se trouve presque toujours dans l'agent que vous avez déjà : le réglage d'effort que vous n'avez jamais ajusté, la boucle qui s'engage trop tôt, les refus que vous encaissez en silence. Nous avons doublé notre score sans toucher au modèle. Ce n'est pas le modèle, mon vieux. C'est l'agent.