hego.red - Практические заметки по red teaming ИИ/LLM

Практические заметки по red teaming ИИ/LLM

Что нового

Это живой блокнот: я добавляю атаки и техники по мере развития области, так что заглядывайте иногда. Вот что изменилось, свежее сверху; каждый пункт ведёт прямо к новому материалу. Нажмите /, чтобы искать по всему.

2026-07-28НОВОЕ
Побеги из песочницы агентов, агенты в CI/CD и CoT Forgery
  • Новый раздел Побег из песочницы агента: DuneSlide (CVE-2026-50548/50549, CVSS 9.8, Cato AI Labs), контент, который агент только читает, доходит до RCE на уровне ОС через working_directory под контролем LLM и сбой канонизации симлинков.
  • Новый раздел Агенты в CI/CD: цепочка из пяти звеньев, которой RyotaK пробил claude-code-action (CVE-2025-66032): обход проверки актора [bot], инъекция через тело issue, /proc/self/environ, обмен OIDC-токена и расползание по цепочке поставок.
  • Подделка цепочки рассуждений теперь ссылается на CoT Forgery (ICML 2026) с измеренными ~60% успеха и объясняет через путаницу ролей, почему приём переносится между моделями.
2026-07-14
Отравление памяти агентов + DeepTeam
  • Новый раздел Отравление памяти агентов: бэкдоры, срабатывающие при извлечении и переживающие сессии (MemPoison, MINJA), плюс межсайтовые атаки на память ИИ-браузеров (ChatGPT Atlas, Perplexity Comet).
  • Добавлен DeepTeam (Confident AI) в Тестирование и инструменты: open-source red teaming агентов, сопоставленный с OWASP Agentic (ASI) Top 10.
2026-06-30
Интегрирована Arcanum Prompt Injection Taxonomy
  • Новый раздел Атаки на модели рассуждения: захват CoT, управление режимом мышления, подделка цепочки рассуждений, принуждение структурированного вывода.
  • Новые джейлбрейки в Современные джейлбрейки: Echo Chamber, Bad Likert Judge, Deceptive Delight, прошедшее/будущее время, плюс Self-Persuasion, DarkCite, SATA и AutoDAN-Turbo.
  • Шесть новых приёмов в Кодирование и сокрытие: Adversarial Poetry, MathPrompt, QueryAttack, CodeAttack, Trojan Source (bidi) и многослойные цепочки кодирования.
  • Новые атаки на экосистему агентов в Агентном фронтире: Tool Rug Pull, Tool Squatting, подделка вызовов инструментов, бэкдор в файле правил, Prompt Worm и спящие пейлоады.
  • Новая таблица Перекрёстная ссылка Arcanum PIT, сопоставляющая коды таксономии с этим сайтом.
  • Одиннадцать новых записей в Терминах, покрывающих всё вышеперечисленное.
2026-06-22
Партия из PayloadsAllTheThings
  • Добавлено Выполнение кода, память и цепочки плагинов: RCE в интерпретаторах кода, инъекция персистентной памяти (spAIware), межплагинная подделка запросов и инъекция в метаданные/комментарии.
  • Новые техники вплетены в Методологию, дерево Схема атаки и Источники.
  • Четыре новых термина в словаре и набор именованных ссылок на научные работы.
2026-06-20
Улучшения чтения и навигации
  • Приглушённый режим чтения и масштаб текста в приложении (A- / A+ или клавиши + - 0), оба запоминаются между визитами.
  • Ссылки-хэши в URL для каждой вкладки и раздела, плюс якорные ссылки на заголовках при наведении.
  • Методология rez0 вынесена в отдельную карточку; проведена оптимизация производительности и добавлен Lighthouse CI.
2026-06-19
hego.red запущен
  • Первый публичный релиз: одностраничный практический гайд по red teaming LLM.