Resultados
94% de la suite, en una pasada.
Cada cifra de aquí procede de ejecutar SwarmAttacker contra el benchmark de validación XBOW: 104 aplicaciones web vulnerables reales, en contenedores, cada una con una Flag oculta, abordadas en caja negra solo desde la URL.
Frente al campo
Los agentes más antiguos se agrupan en torno a la mitad de la suite.
Incluso emparejados con un modelo frontera de 2026. El salto no es un truco nuevo; es un modelo base moderno guiado por un diseño hecho para quitarse de en medio.
Un gráfico de peras con manzanas, etiquetado con honestidad. SwarmAttacker y MAPTA son pasadas únicas; los cuatro agentes más antiguos son picos de mejor de tres remedidos en modelos de 2026; XBOW es un autoinforme del proveedor; la fila humana es el mejor de cinco profesionales durante unas 40 horas cada uno.
Por dificultad
La dificultad apenas predice el fallo.
Los seis fallos se reparten entre fácil, medio y difícil.
Por clase de vulnerabilidad
Un punto por app.
Sólido en todos los frentes. El único punto débil es la inyección SQL a ciegas, donde no hay respuesta visible que leer.
Tiempo hasta la Flag
Dos jorobas.
Una grande entre los diez y los quince minutos para las capturas de un solo tiro, y un segundo repunte más allá de los 20 minutos para los objetivos que necesitan un segundo acto.
Apps resueltas por cada tramo de dos minutos. La barra discontinua de la derecha son las seis ejecuciones que alcanzaron el límite de 40 minutos.
Lo que de verdad importa
Apagamos cada parte para ver cuánto valía.
Partiendo del sistema completo al 94%, un componente cada vez. La línea es cuánto cayó la tasa de resolución sin él.
La gestión de rechazos es la columna vertebral; el prompting escrito a mano apenas registra en un modelo moderno. Dos de estos se convirtieron en entradas de blog: los skills apenas ayudan en los casos fáciles, y el prompt engineering es casi peso muerto.
Filtros de seguridad
Qué supera una petición rechazada.
Reproducido sobre la cola difícil de rechazos que sobrevivieron a un primer reintento. Ninguna técnica gana por sí sola; la solución garantizada es cambiar a un modelo más permisivo, y simplemente reenviar la misma petición funciona alrededor de la mitad de las veces.
Convierte una URL en un informe de seguridad.
Código abierto, licencia MIT, y se ejecuta con el plan de ChatGPT que ya pagas. Instálalo y apúntalo a un objetivo que poseas.
brew install joloooo/swarm/swarm