Pentesting de Inteligencia Artificial y LLMs

Los modelos de lenguaje y los sistemas de IA introducen vectores de ataque completamente nuevos. Evaluamos la seguridad de tu infraestructura de IA antes de que lo haga un adversario real.

¿Por qué la IA necesita un pentesting específico?

Un LLM mal protegido puede revelar datos de entrenamiento confidenciales, ejecutar instrucciones arbitrarias mediante prompt injection o ser manipulado para eludir controles de negocio. Las herramientas de pentesting tradicionales no detectan estos vectores. Se requiere metodología específica alineada con OWASP Top 10 for LLMs y MITRE ATLAS.

Alcance de la evaluación

  • Prompt injection (directa, indirecta y multi-step)
  • Jailbreaking y evasión de controles de seguridad del modelo
  • Exfiltración de datos de entrenamiento o system prompt
  • Insecure output handling y ejecución de código arbitrario
  • Evaluación de pipelines RAG (Retrieval Augmented Generation)
  • Seguridad de plugins, function calling y tool use
  • Insecure plugin design y supply chain de modelos
  • Model denial-of-service y resource exhaustion
  • Revisión de controles de acceso a la API del modelo
  • Alineación con OWASP Top 10 for LLMs 2025 y MITRE ATLAS

Metodología

  1. Threat modeling de IA: Identificamos los activos de IA (modelos, datos, pipelines) y los vectores de amenaza aplicables según MITRE ATLAS.
  2. Evaluación de prompt injection: Pruebas exhaustivas de inyección directa e indirecta, multi-modal y multi-step contra el sistema objetivo.
  3. Análisis del pipeline: Revisamos la cadena completa: ingestión de datos, RAG, function calling, salidas y uso en producción.
  4. Explotación y escalada: Encadenamos vulnerabilidades para demostrar impacto real en datos, usuarios o sistemas conectados.
  5. Informe y remediación: Clasificación por CVSS v4 adaptado a riesgos de IA, con recomendaciones priorizadas y defensas por capas.

Entregables

  • Informe ejecutivo con mapa de riesgos de IA
  • Informe técnico con PoC de cada vulnerabilidad encontrada
  • Clasificación según OWASP Top 10 for LLMs 2025
  • Guía de hardening del sistema de IA
  • Recomendaciones de arquitectura para pipelines seguros
  • Re-test incluido tras remediación

Casos de uso

  • Startups que integran LLMs (GPT-4, Claude, Llama) en sus productos
  • Empresas con chatbots o asistentes virtuales orientados al cliente
  • Plataformas de código con IA (copilots, code generation)
  • Sistemas RAG con acceso a bases de datos corporativas
  • Productos con function calling que acceden a APIs internas

Preguntas frecuentes

¿El pentesting de IA afecta al rendimiento del modelo en producción?

No. Las pruebas se realizan en un entorno de staging o con tráfico controlado. Nunca interferimos con usuarios reales ni degradamos el servicio.

¿Necesito acceso al modelo o solo a la interfaz?

Depende del alcance. Un test de caja negra solo requiere acceso a la interfaz final. Un test completo de pipeline requiere acceso al código del sistema y configuración del modelo.

¿Cubrís modelos open-source desplegados on-premise?

Sí. Evaluamos tanto modelos en cloud (APIs de OpenAI, Anthropic, Google) como modelos open-source (Llama, Mistral, Qwen) desplegados en infraestructura propia.