hego.red - Notas prácticas de red teaming de IA/LLM

Notas prácticas de red teaming de IA/LLM

Alcance: ¿qué pruebas en realidad?

Este es el paso de delimitación de una prueba de LLM, y lo haces antes de atacar nada. La regla es la misma que en una prueba web: pruebas lo que el cliente posee o modificó, no el modelo de terceros intacto. Así que primero mapea el montaje, marca qué es suyo (en alcance) y qué es del proveedor (fuera de alcance), y luego ataca solo lo que está en alcance.

El motor del modelo es la pieza de terceros. Si solo llaman a un modelo del proveedor (Claude / OpenAI) tal cual, el modelo queda fuera de alcance y solo pruebas el envoltorio que construyeron. Si lo autoalojan, lo ajustan o construyen lógica real alrededor, esa parte es suya y está en alcance. El contrato tiene la última palabra, así que confírmalo con el cliente.

Elige cómo lo construyeron: el diagrama te muestra qué está en alcance:

en alcance, pruébalo fuera de alcance, del proveedor no se usa aquí
Tú (tester)
envías prompts, observas el tráfico
Burp / DevTools abiertos
Pregunta: ¿modelo? ¿herramientas? ¿datos?
App del cliente
lo que construyeron alrededor del modelo
Frontend (navegador)
Backend / configuración de integración
Prompt del sistema y reglas
Manejo de entrada / salida
RAG / sus datos
Herramientas / agente
Proveedor / Modelo
donde corre el modelo en sí
API de terceros (Claude / OpenAI)
Autoalojado (Ollama / vLLM) + infra
El modelo (base / ajustado)