IA vs pentesters humanos: 15 minutos frente a 40 horas
BenchmarksPor el equipo de SwarmAttacker en JolocorpPublicado 7 min de lectura

Hace un tiempo, la empresa de seguridad XBOW publicó algo que nos llamó la atención. Cogieron su suite de 104 aplicaciones web vulnerables y se la entregaron a cinco pentesters profesionales, personas de verdad que se dedican a esto. El mejor de los cinco encontró la flag en el 85% de las aplicaciones. Le costó alrededor de 40 horas de trabajo concentrado. Los otros cuatro obtuvieron un 59% o menos.
Apuntamos SwarmAttacker a esas mismas 104 aplicaciones. Resolvió 98 de ellas, un 94%, en una sola pasada. El tiempo mediano para reventar un objetivo fue de 15 minutos.
Así que, en este benchmark, la máquina superó al mejor humano. Y lo hizo en una fracción del tiempo.
Tasa de resolución en la suite de benchmarks XBOW
SwarmAttacker (una sola pasada, GPT-5.5) frente al mejor profesional humano y al resto del grupo. Algunas filas son picos del mejor de tres intentos y una es un dato reportado por el propio proveedor, así que léelas como un mapa aproximado, no como una foto de meta.
Lo que un benchmark CTF deja fuera del trabajo de un pentester
Ese titular es cierto, y no quiero empequeñecerlo. Pero si te vas pensando "la IA acaba de reemplazar a los pentesters", has leído demasiado en ello, y prefiero ser yo quien lo diga.
Esto es un benchmark de capturar la flag. Cada aplicación es una caja autocontenida con una única flag oculta dentro, y todo el trabajo consiste en encontrarla. Eso es una habilidad real y es una buena parte de lo que hacen los pentesters en el día a día. Pero es una parte. No es todo el trabajo.
Lo que un benchmark como este deja fuera es casi todo el trabajo real:
- El alcance. Nadie le dice al agente qué está dentro del alcance, qué es frágil o qué le importa de verdad al cliente. El objetivo simplemente se le entrega.
- Hablar con la gente. No hay reunión de arranque, ni "¿es seguro tocar este servidor?", ni explicar un hallazgo a un ingeniero que no está de acuerdo contigo.
- La lógica de negocio en su contexto. Los fallos aquí son defectos técnicos en una aplicación pequeña, no "este flujo de reembolsos se puede abusar para vaciar la cuenta" en un sistema con mil piezas en movimiento.
- El informe. La mitad del valor que aporta un buen pentester es un documento claro: qué está mal, por qué importa, cómo arreglarlo, ordenado por riesgo. Aquí el agente no hace nada de eso.
- El desorden. Los encargos reales se extienden por la infraestructura enredada de una organización. Encadenas un pequeño punto de apoyo con otro a través de sistemas que nadie documentó del todo. Una caja contenida no pone eso a prueba.
Superar al mejor humano en este benchmark, en esta tarea concreta, es real y medible. No es lo mismo que superar a un humano en el trabajo.
Una última nota de justicia, esta vez en el otro sentido. Los profesionales humanos resolvían objetivos desconocidos bajo presión real de tiempo, en frío, igual que nuestro agente. Así que esto no es "expertos haciéndolo a desgana". Eran buenos testers haciendo un trabajo difícil deprisa, y aun así el agente salió por delante en tasa de resolución bruta. Ambas cosas son ciertas a la vez.
También quiero mantener nuestra propia cifra honesta. El 94% es una única pasada, una ejecución por objetivo, sin escoger el mejor de varios intentos. Algunos de los otros sistemas de ese gráfico son picos del mejor de tres, y uno es un proveedor reportando su propia puntuación. Así que las barras no están todas medidas de la misma manera. Trata el gráfico como un mapa aproximado del campo, no como una clasificación precisa. Puedes indagar exactamente cómo lo contamos en la página de resultados.
¿Por qué esto se hizo posible ahora y no hace dos años?
La pregunta interesante no es "¿ganó la IA?", es "¿por qué se volvió posible de repente?". Hace dos años, los agentes construidos sobre los modelos de entonces puntuaban muy por debajo de esto. El salto no vino de un agente más ingenioso. Vino sobre todo de que el modelo de debajo mejoró drásticamente en exactamente este tipo de resolución de problemas abierta y en varios pasos. Escribimos sobre ese cambio en por qué los diseños de agente antiguos funcionan mejor en modelos nuevos.
Lo que cambia una primera pasada automatizada de 15 minutos
Aquí viene la parte que de verdad me entusiasma, y no tiene nada que ver con que nadie pierda su empleo.
Ahora mismo, una prueba de seguridad como es debido es cara y lenta, así que la mayoría del software nunca recibe una. Las startups publican sin ella. Las herramientas internas se publican sin ella. Ese proyecto paralelo que maneja datos reales de usuarios se publica sin ella. Un encargo humano cuesta dinero de verdad y tarda semanas en agendarse, así que se reserva para las pocas cosas lo bastante importantes como para justificarlo.
Una primera pasada automatizada de 15 minutos cambia las cuentas. No porque reemplace al encargo humano profundo, no lo hace, sino porque puede ejecutarse sobre todo. Cada aplicación, cada servicio, cada commit, antes de que una persona siquiera lo mire. Detecta los fallos obvios de forma automática y barata, y liberas a los expertos humanos para dedicar sus 40 horas al trabajo difícil, contextual y cargado de criterio que un benchmark nunca podrá capturar.
Esa es la historia aquí. No "los pentesters están obsoletos". Más bien "las pruebas de seguridad acaban de abaratarse lo suficiente como para ejecutarlas sobre cosas que antes nos saltábamos". Los mejores humanos siguen por delante donde más importa. Simplemente hay ahora muchos más sitios donde una máquina puede echar el primer vistazo.


