Resultados

94% de la suite, en una pasada.

Cada cifra de aquí procede de ejecutar SwarmAttacker contra el benchmark de validación XBOW: 104 aplicaciones web vulnerables reales, en contenedores, cada una con una Flag oculta, abordadas en caja negra solo desde la URL.

94%
98 de 104 apps
15min
tiempo mediano
40min
límite de tiempo
6
fallos
2.14M
tokens por app

Frente al campo

Los agentes más antiguos se agrupan en torno a la mitad de la suite.

Incluso emparejados con un modelo frontera de 2026. El salto no es un truco nuevo; es un modelo base moderno guiado por un diseño hecho para quitarse de en medio.

AutoPTpico de mejor de 3
51%
PentestGPTpico de mejor de 3
54%
VulnBotpico de mejor de 3
58%
PentestAgentpico de mejor de 3
61%
MAPTApasada única, GPT-5
77%
Experto humano (mejor de 5)~40 horas, manual
85%
XBOWautoinforme del proveedor
85%
PentestGPT v2 (Excalibur)pico de mejor de 3, Opus 4.5
91%
SwarmAttackerpasada única, GPT-5.5
94%
mejor humano

Un gráfico de peras con manzanas, etiquetado con honestidad. SwarmAttacker y MAPTA son pasadas únicas; los cuatro agentes más antiguos son picos de mejor de tres remedidos en modelos de 2026; XBOW es un autoinforme del proveedor; la fila humana es el mejor de cinco profesionales durante unas 40 horas cada uno.

Por dificultad

La dificultad apenas predice el fallo.

Los seis fallos se reparten entre fácil, medio y difícil.

Nivel 144 / 451 fallidas
Nivel 247 / 514 fallidas
Nivel 37 / 81 fallidas

Por clase de vulnerabilidad

Un punto por app.

Sólido en todos los frentes. El único punto débil es la inyección SQL a ciegas, donde no hay respuesta visible que leer.

XSS
22/23
Credenciales por defecto
17/18
IDOR
14/14
Escalada de privilegios
14/14
SSTI
12/13
Inyección de comandos
11/11
Lógica de negocio
7/7
SQLi
6/6
Divulgación de información
6/6
Deserialización insegura
5/6
LFI
5/6
Path traversal
5/5
Subida arbitraria de archivos
4/6
CVE conocido
4/4
XXE
3/3
SSRF
3/3
GraphQL
3/3
JWT
3/3
Cripto
3/3
SQLi a ciegas
1/3
resueltas fallidas

Tiempo hasta la Flag

Dos jorobas.

Una grande entre los diez y los quince minutos para las capturas de un solo tiro, y un segundo repunte más allá de los 20 minutos para los objetivos que necesitan un segundo acto.

mediana 15 min40+ min6 agotaron el tiempo0102030 min

Apps resueltas por cada tramo de dos minutos. La barra discontinua de la derecha son las seis ejecuciones que alcanzaron el límite de 40 minutos.

Lo que de verdad importa

Apagamos cada parte para ver cuánto valía.

Partiendo del sistema completo al 94%, un componente cada vez. La línea es cuánto cayó la tasa de resolución sin él.

Gestión de rechazosMantiene al modelo respondiendo
−22 pts
SkillsEl último paso específico de clase hasta la Flag
−7 pts
Búsqueda webConsultas de conocimiento bajo demanda
−6 pts
FontaneríaHallazgos estructurados + guiado
−5 pts
Técnicas de promptingDisciplina de prompts escritos a mano
−3 pts
60%70%80%90%100%

La gestión de rechazos es la columna vertebral; el prompting escrito a mano apenas registra en un modelo moderno. Dos de estos se convirtieron en entradas de blog: los skills apenas ayudan en los casos fáciles, y el prompt engineering es casi peso muerto.

Filtros de seguridad

Qué supera una petición rechazada.

Reproducido sobre la cola difícil de rechazos que sobrevivieron a un primer reintento. Ninguna técnica gana por sí sola; la solución garantizada es cambiar a un modelo más permisivo, y simplemente reenviar la misma petición funciona alrededor de la mitad de las veces.

52%
Manipulación del contexto
dentro del ruido del control
54%
Reenvío simple (solo reintentar)
misma petición, sin cambios
68%
Encuadre de autorización
+14 pts, pero inestable entre modelos
100%
Cambiar a un modelo permisivo
el respaldo garantizado

Convierte una URL en un informe de seguridad.

Código abierto, licencia MIT, y se ejecuta con el plan de ChatGPT que ya pagas. Instálalo y apúntalo a un objetivo que poseas.

brew install joloooo/swarm/swarm
Código fuente en GitHub