Notas prácticas de red teaming de IA/LLM
hego.red es mi cuaderno personal para hackear sistemas de IA, ordenado y compartido. Repasé cientos de fuentes, artículos, charlas, cursos e investigaciones, y las mezclé en un solo lugar claro, para que tú no tengas que rebuscar. Es la guía que me habría gustado tener cuando empecé, y te lleva desde tu primera inyección de prompts hasta atacar apps de LLM reales.
Todo aquí trata de lo que de verdad funciona en objetivos reales, no solo teoría. Aprendes cómo se rompen los LLM, todos los ataques principales (inyección de prompts, jailbreaks, inyección indirecta, robo de datos y abuso de herramientas y agentes), y una forma clara y paso a paso de probarlos que sigue el OWASP LLM Top 10 y MITRE ATLAS. También hay laboratorios prácticos resueltos (incluyendo guías de PortSwigger) para que practiques. Está todo escrito desde el punto de vista del atacante, así que puedes usarlo de inmediato.
Lo mantengo actualizado a medida que las cosas cambian y aprendo nuevos trucos, así que vuelve de vez en cuando. Empieza en Fundamentos, recorre las pestañas en orden, marca las casillas conforme avanzas y pulsa / para buscar. Un Laboratorio práctico llegará pronto.
Hecho por hego.