hego.red - Notas prácticas de red teaming de IA/LLM

Notas prácticas de red teaming de IA/LLM

Novedades

Este es un cuaderno vivo: añado ataques y técnicas a medida que el campo avanza, así que vuelve de vez en cuando. Esto es lo que cambió, lo más reciente primero; cada elemento enlaza directo al nuevo contenido. Pulsa / para buscar en todo.

2026-07-28NUEVO
Escapes de sandbox en agentes, agentes en CI/CD y CoT Forgery
  • Nueva sección Escape del sandbox del agente: DuneSlide (CVE-2026-50548/50549, CVSS 9.8, Cato AI Labs), contenido de solo lectura que llega hasta RCE en el sistema mediante un working_directory controlado por el LLM y un fallo de canonicalización de symlinks.
  • Nueva sección Agentes en CI/CD: la cadena de cinco eslabones que RyotaK usó contra claude-code-action (CVE-2025-66032): bypass del actor [bot], inyección por el cuerpo del issue, /proc/self/environ, canje de token OIDC y propagación por la cadena de suministro.
  • La falsificación de la cadena de pensamiento ahora cita CoT Forgery (ICML 2026) con su ~60% de éxito medido, y la razón de confusión de roles por la que se transfiere entre modelos.
2026-07-14
Envenenamiento de memoria de agentes + DeepTeam
  • Nueva sección Envenenamiento de memoria de agentes: puertas traseras activadas por recuperación que persisten entre sesiones (MemPoison, MINJA), más ataques de memoria entre sitios en navegadores de IA (ChatGPT Atlas, Perplexity Comet).
  • Se añadió DeepTeam (Confident AI) a Pruebas y Herramientas: red teaming de agentes de código abierto mapeado al OWASP Agentic (ASI) Top 10.
2026-06-30
Integrada la Taxonomía de Inyección de Prompts de Arcanum
  • Nueva sección Ataques a modelos de razonamiento: secuestro de CoT, dirección del modo de pensamiento, falsificación de la cadena de pensamiento, coerción de salida estructurada.
  • Nuevos jailbreaks en Jailbreaks modernos: Echo Chamber, Bad Likert Judge, Deceptive Delight, reformulación en pasado/futuro, más Self-Persuasion, DarkCite, SATA y AutoDAN-Turbo.
  • Seis trucos nuevos en Codificación y ocultación: Adversarial Poetry, MathPrompt, QueryAttack, CodeAttack, Trojan Source (bidi) y cadenas de codificación en capas.
  • Nuevos ataques al ecosistema de agentes en la Frontera agéntica: Tool Rug Pull, Tool Squatting, falsificación de llamadas a herramientas, puerta trasera en archivos de reglas, gusano de prompts y payloads durmientes.
  • Nueva tabla de referencias cruzadas de Arcanum PIT que mapea los códigos de la taxonomía a este sitio.
  • Once nuevas entradas de Terminología que cubren todo lo anterior.
2026-06-22
Lote de PayloadsAllTheThings
  • Se añadió Ejecución de código, memoria y encadenamiento de plugins: RCE en intérpretes de código, inyección de memoria persistente (spAIware), falsificación de peticiones entre plugins e inyección en metadatos/comentarios.
  • Se entrelazaron las nuevas técnicas a lo largo de Metodología, el árbol de Flujo de ataque y Fuentes.
  • Cuatro nuevos términos de glosario y un conjunto de referencias tituladas a artículos académicos.
2026-06-20
Mejoras de lectura y navegación
  • Modo de lectura atenuado y zoom de texto en la app (A- / A+, o las teclas + - 0), ambos recordados entre visitas.
  • Anclas de URL compartibles para cada pestaña y sección, más enlaces de ancla al pasar el cursor sobre los encabezados.
  • La metodología de rez0 separada en su propia tarjeta; se añadió una pasada de rendimiento y Lighthouse CI.
2026-06-19
hego.red se lanzó
  • Primer lanzamiento público: la guía práctica de una sola página para el red teaming de LLM.