hego.red - Практические заметки по red teaming ИИ/LLM

Практические заметки по red teaming ИИ/LLM

Область: что вы на самом деле тестируете?

Это этап определения области работ в тесте LLM, и вы делаете его до любых атак. Правило то же, что и в веб-тесте: вы тестируете то, чем владеет или что изменил клиент, а не нетронутую стороннюю модель. Поэтому сначала составьте карту, отметьте, что их (в области работ) и что вендора (вне области), и атакуйте только то, что в области работ.

Движок модели, это сторонняя часть. Если они просто вызывают модель вендора (Claude / OpenAI) как есть, модель вне области работ, и вы тестируете только обвязку, которую они построили. Если они хостят её сами, дообучают или строят вокруг реальную логику, эта часть их и в области работ. Последнее слово за договором, поэтому уточните у клиента.

Выберите, как они это построили: схема покажет, что в области работ:

в области работ: тестируйте вне области: вендора здесь не используется
Вы (тестировщик)
отправляете промпты, смотрите трафик
Burp / DevTools открыты
Спросите: модель? инструменты? данные?
Приложение клиента
что они построили вокруг модели
Фронтенд (браузер)
Бэкенд / конфиг интеграции
Системный промпт и правила
Обработка ввода / вывода
RAG / их данные
Инструменты / агент
Провайдер / модель
где работает сама модель
Сторонний API (Claude / OpenAI)
Свой хостинг (Ollama / vLLM) + инфраструктура
Модель (базовая / дообученная)