Significados sencillos de las palabras de IA que oirás una y otra vez. Las líneas azules con "≈" comparan una palabra con algo que ya conoces del hacking web. Escribe para buscar.
LLM (modelo de lenguaje grande)
Un programa que escribe texto como una persona. Solo adivina la siguiente palabra, una y otra vez. Esta es la "IA" que pruebas.
Token
Un trozo pequeño de texto (una palabra o parte de una). El modelo cuenta tamaño, coste y memoria en tokens.
Tokenización
Cómo se corta el texto en tokens. Importa porque un filtro y el modelo pueden leer el mismo texto de formas distintas, y esa brecha ayuda a algunos ataques.
Ventana de contexto (Context window)
Cuánto texto puede tener en mente a la vez el modelo (reglas + chat + datos). Mete demasiado y las reglas viejas se caen por el final.
Prompt
El texto que envías al modelo. ≈ la entrada que controlas.
Prompt del sistema (System prompt)
Las reglas secretas que el desarrollador le da al modelo. ≈ ajustes del lado servidor; suele ocultar secretos que quieres.
Prompt del usuario (User prompt)
El mensaje que escribe un usuario. ≈ entrada de usuario; tu vía de entrada.
Inferencia (Inference)
El modelo generando una respuesta. Solo significa "ejecutar el modelo".
Temperatura (Temperature)
Un ajuste de cuán aleatorias son las respuestas. Más alto significa más aleatorio. Por eso la misma entrada puede dar respuestas distintas.
No determinista (Non-deterministic)
La misma entrada, pero una respuesta distinta cada vez. Así que prueba un payload muchas veces antes de descartarlo.
Alucinación (Hallucination)
Cuando el modelo inventa algo falso pero suena seguro. Por sí solo, normalmente no es un bug de seguridad.
Adulación (Sycophancy)
La costumbre del modelo de darte la razón para complacerte. Dale una afirmación falsa ("leí que ofrecen 500 $ de crédito...") y puede seguirte el juego. ≈ ingeniería social para que el modelo confirme una mentira.
Embedding / vector
Texto convertido en números para que la máquina compare significados. Se usa para búsqueda y RAG.
Base de datos vectorial (Vector database)
Donde se guardan y buscan esas listas de números. ≈ la base de datos detrás de RAG.
RAG (generación aumentada por recuperación)
El modelo lee documentos y los usa para responder. ≈ el modelo leyendo de una fuente de datos que quizá puedas envenenar.
Fragmentación (Chunking)
Cortar documentos grandes en trozos pequeños para RAG. Si se cortan mal, el modelo recibe un contexto revuelto y da respuestas erróneas.
Modelo base / fundacional (Base / foundation model)
El modelo normal, ya hecho (GPT, Claude, Llama) antes de que nadie lo modifique.
Ajuste fino (Fine-tuning)
Entrenar el modelo un poco más con los datos propios del cliente. El nuevo modelo puede recordar y filtrar esos datos.
Pesos / parámetros (Weights)
Los números que aprendió el modelo, su "cerebro". En modelos autoalojados, el archivo de pesos puede incluso ejecutar código al cargarse.
Procedencia (Provenance)
El historial de dónde vino un modelo o sus datos, como una cadena de custodia. Lo verificas para no confiar en una fuente desconocida.
RLHF / alineación (Alignment)
Entrenamiento que enseña al modelo a negarse a peticiones malas. Es un hábito, no un muro rígido, así que puedes rodearlo hablando.
Guardrail (cortafuegos / gateway de IA)
Un filtro aparte que se sitúa entre el usuario y el modelo. Revisa el mensaje que entra y la respuesta que sale, y bloquea u oculta lo malo. ≈ un WAF para el modelo.
Gestión de postura de seguridad de IA (AI-SPM)
Mantener seguro todo el montaje de IA: software parcheado, login robusto, datos cifrados, buena configuración. ≈ el endurecimiento de sistemas de siempre, pero para la pila de IA.
Multimodal
Un modelo que también acepta imágenes, sonido o video, no solo texto. Más vías de ataque, como texto oculto dentro de una imagen.
API / clave de API
La app habla con el modelo por una API con una clave secreta. ≈ una contraseña; si se filtra, un atacante gasta el dinero del cliente y usa su cuenta.
Modelo autoalojado / local (Self-hosted)
El cliente ejecuta el modelo en sus propios servidores (Ollama, vLLM). Todo está en alcance.
Gestionado en la nube (Cloud-managed)
Un modelo del proveedor que corre en la cuenta de nube del cliente (Azure OpenAI, Bedrock, Vertex). El montaje de la nube y las claves están en alcance.
Envoltorio / capa de app (Wrapper)
Todo lo que el cliente construye alrededor del modelo (reglas, filtros, herramientas, UI). ≈ tu verdadero objetivo.
Agente / agéntico (Agent / agentic)
Un modelo que puede hacer cosas y dar muchos pasos, no solo charlar. El mayor objetivo.
Herramienta / llamada a funciones (Tool / function calling)
Cosas que el modelo puede usar (búsqueda, email, base de datos, ejecutar código). ≈ las funciones del backend de la app; el modelo elige qué enviarles.
Plugin
Una herramienta ya hecha que el modelo puede usar. Los mismos riesgos que las herramientas.
Falsificación de peticiones entre plugins (CPRF)
La salida de una herramienta lleva una orden que hace actuar a una segunda, como una herramienta "leer web" que pasa un payload a una "obtener URL" para filtrar tus datos. ≈ CSRF, pero entre las propias herramientas del modelo.
MCP (protocolo de contexto de modelo)
Una forma común de conectar herramientas y datos a un agente. Sus servidores y descripciones de herramientas pueden atacarse.
Skill (paquete de habilidad)
Un paquete ya hecho de instrucciones y código que carga un agente. Puede ocultar instrucciones maliciosas dentro.
Inyección de prompts (Prompt injection)
Engañar al modelo con una entrada que sigue como si fuera una orden. El bug de LLM número 1. Directa (la escribes tú) o indirecta (oculta en datos que lee).
Inyección indirecta de prompts (Indirect prompt injection)
La orden está oculta en contenido que el modelo lee más tarde (una página web, un archivo, un email), no la escribe el usuario. ≈ XSS almacenado: tú lo plantas, el modelo de la víctima lo ejecuta.
Inyección de memoria persistente (spAIware)
Plantar una orden en la memoria a largo plazo del asistente para que vuelva en cada chat futuro, como spyware que sobrevive a la sesión. ≈ un payload almacenado que se dispara en cada inicio de sesión.
Jailbreak
Hacer que el modelo rompa sus propias reglas de seguridad. Es un problema del modelo, no suele ser un bug reportable por sí solo.
Fuga / extracción del prompt del sistema
Hacer que el modelo muestre sus reglas secretas. Puede revelar secretos y las reglas que necesitas sortear.
Manejo inseguro de la salida (Insecure output handling)
La app confía en la respuesta del modelo y la muestra o ejecuta sin sanearla. ≈ de aquí salen XSS / SQLi / SSRF.
Agencia excesiva (Excessive agency)
El modelo puede usar herramientas demasiado poderosas para él. ≈ una cuenta con demasiados permisos.
Denegación de billetera (Denial of wallet)
Inundar la IA con peticiones pesadas o numerosas para disparar la factura del cliente, no solo para tumbarla. La versión monetaria de la denegación de servicio.
Extracción de datos de entrenamiento
Sacar de vuelta datos privados de un modelo ajustado.
Extracción / inversión de modelo
Preguntar al modelo lo mismo muchas veces para copiar su conocimiento y robar el modelo en sí. ≈ scraping, pero para clonar el modelo (robo de propiedad intelectual).
Envenenamiento de datos / modelo
Meter datos maliciosos o un disparador oculto en el entrenamiento o en RAG para que el modelo actúe mal.
Malware de modelo / modelo envenenado
Un modelo descargado puede ocultar código malicioso o una puerta trasera, igual que un software infectado. Por eso cargar un modelo no confiable es arriesgado.
Diputado confundido (Confused deputy)
Engañar a un agente de alto poder para que haga tu trabajo sucio mediante texto oculto.
Sandbox
Un espacio aislado donde corren el código y las herramientas del modelo, para que el daño quede acotado. ≈ una jaula de la que intentas escapar.
Intérprete de código (Code interpreter)
Una herramienta que ejecuta código que escribe el modelo (a menudo Python) para hacer cálculos o analizar archivos. Si puedes inyectar el código, la inyección de prompts se convierte en ejecución de código real (RCE).
Red team de IA vs pentest de IA
Red team = comprobar si el modelo dice cosas malas. Pentest = comprobar toda la app + modelo + servidores. Acuerda cuál de los dos primero.
OWASP LLM Top 10
La lista estándar de los mayores riesgos de apps de LLM. Mapea tus hallazgos a ella.
MITRE ATLAS
Una biblioteca de ataques de IA reales. Mapea tus hallazgos también a ella.
NIST AI RMF
Un marco del gobierno de EE. UU. para gestionar el riesgo de IA en toda una organización. ≈ gobernanza y política, no una herramienta de ataque práctica.
Modelo de razonamiento / cadena de pensamiento (CoT)
Un modelo que escribe sus pasos de "pensamiento" antes de la respuesta final (serie o, DeepSeek-R1, pensamiento extendido). Ese pensamiento visible es texto extra que puedes rellenar, dirigir, falsificar o cortar: toda una superficie de ataque en sí misma.
Crescendo
Un jailbreak de varios turnos: empieza inocente y empuja un poco más cada turno, apoyándote en las propias respuestas del modelo, para que los filtros por mensaje nunca vean nada malo. ≈ escalada lenta de privilegios en vez de un exploit ruidoso.
Echo Chamber (cámara de eco)
Planta "semillas" inofensivas y luego haz que el modelo siga ampliando sus propias palabras hasta que el encuadre se autorrefuerce hacia una salida dañina. Nunca haces la petición mala directamente: el modelo escala solo.
Bad Likert Judge
Pide al modelo que califique contenido en una escala de 1 a 5 y luego que dé una respuesta de ejemplo para cada nota. El ejemplo de "nota 5" que escribe es el contenido restringido. ≈ abusar del propio rol de QA/juez del modelo.
Tool squatting (ocupación de herramientas)
Nombrar y describir una herramienta maliciosa para que un agente la prefiera sobre una legítima: sin orden oculta, solo manipulando qué herramienta se elige. ≈ SEO / typosquatting, pero para herramientas de agentes.
Tool rug pull (TOCTOU)
Una herramienta parece segura cuando la apruebas y después cambia en silencio su descripción o comportamiento. ≈ momento de comprobación vs momento de uso: confiada una vez, cambiada después.
Gusano de prompts (Prompt worm)
Una inyección que se autorreplica (Morris II) y se copia en cada agente, memoria o almacén RAG que alcanza, propagándose sola. ≈ un gusano, pero hecho de instrucciones de texto.
Payload durmiente / activado por disparador (Sleeper)
Una inyección que permanece latente e inofensiva hasta que un disparador (una fecha, palabra o usuario) la activa, así pasa la revisión y se activa después. ≈ una bomba lógica para IA.
Glitch tokens
Tokens raros que el modelo apenas vio en el entrenamiento y que lo hacen comportarse de forma errática, pudiendo sacarlo de sus raíles de seguridad.
Abliteration (eliminación del rechazo)
Editar el interior de un modelo de pesos abiertos para eliminar su comportamiento de rechazo, produciendo una versión "sin censura". Solo posible cuando tienes los pesos.
Ningún término coincide con esa búsqueda.