Agentes viejos, modelos nuevos: siguen en la mitad
BenchmarksPor el equipo de SwarmAttacker en JolocorpPublicado 7 min de lectura

Aquí hay un hecho que debería resultar extraño. Los agentes de pentest construidos en 2023 y 2024 se escribieron para GPT-4, cuando GPT-4 era el mejor cerebro que el dinero podía comprar. Esos mismos agentes pueden ejecutarse hoy sobre un modelo frontera de 2026, la misma clase de modelo que usa SwarmAttacker. Nadie tiene que reescribir una línea de código para hacerlo. Solo apuntas el harness antiguo a la nueva API.
Y cuando lo haces, cuando les das a los agentes antiguos el cerebro más inteligente que existe, ¿hasta dónde llegan? Más o menos a la mitad del benchmark. Todavía.
Agentes de pentest antiguos, medidos de nuevo sobre modelos nuevos
Ejecutamos cada sistema contra la misma suite de aplicaciones web vulnerables: lo apuntas a un objetivo y tiene que encontrar la flag. Medidos de nuevo sobre los modelos frontera actuales, los agentes antiguos quedan en un grupo muy compacto:
- AutoPT resuelve el 51%.
- PentestGPT resuelve el 54%.
- VulnBot resuelve el 58%.
- PentestAgent resuelve el 61%.
SwarmAttacker resuelve el 94%. Y aquí está la parte que importa para una comparación justa: esas cifras antiguas son picos de mejor-de-tres. Ejecutamos cada uno tres veces y nos quedamos con su puntuación más afortunada. El 94% de SwarmAttacker es una sola pasada, un intento, sin reintentos en el nivel superior. Si acaso, la brecha del gráfico de abajo está dibujada con demasiada generosidad hacia la vieja guardia.
La misma clase de modelo, resultados muy distintos
Agentes antiguos medidos de nuevo sobre modelos frontera de 2026 (picos de mejor-de-tres) frente a SwarmAttacker (una sola pasada sobre GPT-5.5). Todos tienen acceso al mismo cerebro; los resultados no se parecen.
Si el modelo es el mismo, ¿qué es lo distinto?
Ese es todo el punto. Hoy todo el mundo tiene un modelo frontera. Es una commodity, está a una clave de API de distancia. Si la capacidad bruta del modelo fuera lo que resuelve estos objetivos, los agentes antiguos deberían haberse disparado en el momento en que se apuntaron a un modelo de 2026. No lo hicieron. Se movieron un poco y luego chocaron con el mismo techo de siempre.
La razón es que un modelo inteligente no es lo mismo que un objetivo resuelto. Entre ambos está el harness: todo lo que rodea al modelo y convierte sus conjeturas en trabajo terminado. Ahí es donde SwarmAttacker invierte su esfuerzo, y es exactamente la parte que los agentes antiguos nunca construyeron:
- Un swarm, no un solista. En lugar de un solo agente razonando paso a paso sobre un objetivo, SwarmAttacker despliega workers en paralelo que exploran distintas pistas a la vez, de modo que un callejón sin salida en un camino no detiene toda la ejecución.
- Gestión de rechazos. Los modelos frontera rechazan de forma rutinaria el trabajo de seguridad, incluso el trabajo de seguridad plenamente autorizado. Un agente que toma el primer rechazo como un no simplemente se detiene. Recuperarse de eso vale más que cualquier truco de prompt.
- Hallazgos estructurados. Lo que descubre un worker queda escrito en una forma limpia y compartida sobre la que el resto de la ejecución puede construir, en lugar de disolverse en un muro de historial de chat.
- Un bucle que se observa a sí mismo. El agente observa lo que hizo realmente cada acción, nota cuándo está atascado y replanifica en lugar de cavar más hondo en una mala idea.
El modelo es el motor. El harness es el coche. Poner un motor mejor en un coche sin ruedas no lo hace más rápido.
La única excepción, PentestGPT v2, reconstruyó su harness
Hay un caso atípico moderno, y es importante ser honesto al respecto. PentestGPT v2, con nombre en clave Excalibur, alcanza un 91% en su pico de mejor-de-tres ejecutándose sobre Claude Opus 4.5. Es un resultado realmente sólido, muy cerca de la cima de la tabla.
Pero mira por qué está ahí arriba. Excalibur no es el viejo PentestGPT con una clave de API nueva; es un agente reconstruido con un harness reconstruido alrededor del modelo. Que es el mismo argumento, hecho desde la otra dirección. Cuando alguien rehace la arquitectura, el número se mueve. Cuando alguien solo cambia el modelo debajo de una arquitectura antigua, no. El único agente que cerró la brecha lo hizo cambiando justo lo que este post dice que importa.
La lección para quien esté construyendo uno de estos
Es tentador, cada vez que sale un modelo nuevo, asumir que tu agente acaba de mejorar gratis. A veces lo hizo, un poco. Pero el techo con el que sigues chocando casi nunca es ya el modelo; es el andamiaje que envolviste a su alrededor hace un año y nunca volviste a revisar. Los agentes de pentest antiguos son una demostración en vivo: el mismo cerebro que todos los demás, todavía atascados a la mitad.
Si quieres apalancamiento, gástalo en el harness, en la orquestación, la recuperación, la memoria, el bucle, no en esperar al siguiente modelo. Esa es la tesis detrás de SwarmAttacker, y es la razón por la que es el agente, no el modelo, lo que seguimos señalando. Puedes ver el desglose completo de lo que SwarmAttacker resolvió realmente en la página de resultados.


