Практические заметки по red teaming ИИ/LLM
hego.red, это мой личный блокнот по взлому ИИ-систем, приведённый в порядок и опубликованный. Я прошёл сотни источников, статей, докладов, курсов и исследований и свёл их в одно понятное место, чтобы вам не пришлось копаться. Это гайд, который я хотел бы иметь, когда начинал, и он ведёт вас от первой инъекции промптов до атак на реальные LLM-приложения.
Здесь всё о том, что реально работает на настоящих целях, а не только теория. Вы узнаете, как ломаются LLM, все основные атаки (инъекция промптов, джейлбрейки, непрямая инъекция, кража данных и злоупотребление инструментами и агентами), и понятный пошаговый способ их тестировать по OWASP LLM Top 10 и MITRE ATLAS. Есть также разобранные практические лаборатории (включая прохождения PortSwigger), чтобы попрактиковаться. Всё написано с точки зрения атакующего, чтобы вы могли применять сразу.
Я обновляю его по мере изменений и по мере того, как узнаю новые приёмы, так что заглядывайте иногда. Начните с Основ, идите по вкладкам по порядку, отмечайте пункты по ходу и нажимайте / для поиска. Практическая Лаборатория скоро появится.
Сделано hego.