Простые значения слов про ИИ, которые вы будете слышать постоянно. Синие строки "≈" сравнивают слово с тем, что вы уже знаете из веб-хакинга. Печатайте для поиска.
LLM (Large Language Model)
Программа, которая пишет текст как человек. Она просто угадывает следующее слово, снова и снова. Это тот самый "ИИ", который вы тестируете.
Token
Небольшой кусочек текста (слово или часть слова). Модель считает размер, стоимость и память в токенах.
Tokenization
Как текст режется на токены. Это важно, потому что фильтр и модель могут читать один и тот же текст по-разному, и этот зазор помогает некоторым атакам.
Context window
Сколько текста модель может удерживать одновременно (правила + чат + данные). Добавьте слишком много, и старые правила выпадут за край.
Prompt
Текст, который вы отправляете модели. ≈ ввод, который вы контролируете.
System prompt
Секретные правила, которые разработчик даёт модели. ≈ серверные настройки; часто прячут секреты, которые вам нужны.
User prompt
Сообщение, которое вводит пользователь. ≈ пользовательский ввод; ваша точка входа.
Inference
Формирование ответа моделью. Попросту означает "запуск модели".
Temperature
Настройка того, насколько случайны ответы. Выше, значит случайнее. Поэтому один и тот же ввод может давать разные ответы.
Non-deterministic
Один и тот же ввод, но ответ каждый раз разный. Поэтому пробуйте пейлоад много раз, прежде чем от него отказаться.
Hallucination
Когда модель выдумывает что-то ложное, но звучит уверенно. Само по себе это обычно не баг безопасности.
Sycophancy
Склонность модели соглашаться с вами, чтобы угодить. Подсуньте ей ложное утверждение ("я читал, что вы даёте кредит на $500...") и она может подыграть. ≈ социальная инженерия, чтобы модель подтвердила ложь.
Embedding / vector
Текст, превращённый в числа, чтобы компьютер мог сравнивать смысл. Используется для поиска и RAG.
Vector database / store
Где хранятся и ищутся эти списки чисел. ≈ база данных за RAG.
RAG (Retrieval-Augmented Generation)
Модель читает документы и использует их для ответа. ≈ модель читает из источника данных, который вы, возможно, сможете отравить.
Chunking
Нарезка больших документов на маленькие куски для RAG. Если куски нарезаны плохо, модель получает спутанный контекст и даёт неверные ответы.
Base / foundation model
Обычная, готовая модель (GPT, Claude, Llama) до того, как её кто-то изменит.
Fine-tuning
Дообучение модели на собственных данных клиента. Новая модель может запомнить и слить эти данные.
Weights / parameters
Числа, которые выучила модель, её "мозг". У самостоятельно размещённых моделей файл весов может даже выполнить код при загрузке.
Provenance
История происхождения модели или её данных, как цепочка ответственности. Вы её проверяете, чтобы не доверять неизвестному источнику.
RLHF / alignment
Обучение, которое учит модель отказывать на плохие запросы. Это привычка, а не глухая стена, поэтому её можно обойти уговорами.
Guardrail (AI firewall / AI gateway)
Отдельный фильтр между пользователем и моделью. Он проверяет входящее сообщение и исходящий ответ, блокирует или прячет плохое. ≈ WAF для модели.
AI Security Posture Management (AI-SPM)
Поддержание безопасности всей ИИ-инфраструктуры: пропатченный софт, надёжный вход, шифрование данных, хорошая конфигурация. ≈ обычное укрепление систем, но для ИИ-стека.
Multimodal
Модель, которая принимает не только текст, но и изображения, звук или видео. Больше способов атаки, например текст, спрятанный внутри картинки.
API / API key
Приложение общается с моделью через API по секретному ключу. ≈ пароль; если он утечёт, атакующий тратит деньги клиента и пользуется его аккаунтом.
Self-hosted / local model
Клиент запускает модель на своих серверах (Ollama, vLLM). Всё в области работ.
Cloud-managed
Модель вендора, запущенная в облачном аккаунте клиента (Azure OpenAI, Bedrock, Vertex). Настройка облака и ключи в области работ.
Wrapper / app layer
Всё, что клиент строит вокруг модели (правила, фильтры, инструменты, UI). ≈ ваша настоящая цель.
Agent / agentic
Модель, которая может действовать и делать много шагов, а не только болтать. Самая крупная цель.
Tool / function calling
То, чем может пользоваться модель (поиск, почта, база данных, запуск кода). ≈ бэкенд-функции приложения; модель выбирает, что им передать.
Plugin
Готовый инструмент, которым может пользоваться модель. Те же риски, что и у инструментов.
Cross-plugin request forgery (CPRF)
Вывод одного инструмента несёт приказ, заставляющий сработать второй инструмент, например инструмент "чтения веба" передаёт пейлоад инструменту "загрузки URL", чтобы слить ваши данные. ≈ CSRF, но между собственными инструментами модели.
MCP (Model Context Protocol)
Распространённый способ подключать инструменты и данные к агенту. Его серверы и описания инструментов можно атаковать.
Skill
Готовый пакет инструкций и кода, который загружает агент. Внутри могут прятаться вредные инструкции.
Prompt injection
Обман модели вводом, который она выполняет как приказ. Баг LLM №1. Прямая (вы её вводите) или непрямая (спрятана в данных, которые она читает).
Indirect prompt injection
Приказ спрятан в контенте, который модель прочитает позже (веб-страница, файл, письмо), а не введён пользователем. ≈ хранимый XSS: вы его закладываете, модель жертвы его выполняет.
Persistent memory injection (spAIware)
Закладка приказа в долговременную память ассистента, чтобы он возвращался в каждом будущем чате, как шпионская программа, пережившая сессию. ≈ хранимый пейлоад, который срабатывает при каждом входе.
Jailbreak
Заставить модель нарушить собственные правила безопасности. Это проблема модели, обычно не баг, который можно репортить сам по себе.
System prompt leak / extraction
Заставить модель показать свои секретные правила. Может раскрыть секреты и правила, которые вам нужно обойти.
Insecure output handling
Приложение доверяет ответу модели и показывает или выполняет его без очистки. ≈ отсюда берутся XSS / SQLi / SSRF.
Excessive agency
Модель может пользоваться слишком мощными для неё инструментами. ≈ аккаунт со слишком большими правами.
Denial of wallet
Заваливание ИИ тяжёлыми или многочисленными запросами, чтобы раздуть счёт клиента, а не просто уронить систему. Денежная версия отказа в обслуживании.
Training-data extraction
Извлечение приватных данных обратно из дообученной модели.
Model extraction / inversion
Многократные однотипные запросы к модели, чтобы скопировать её знания и украсть саму модель. ≈ скрейпинг, но для клонирования модели (кража ИС).
Data / model poisoning
Внедрение плохих данных или скрытого триггера в обучение или RAG, чтобы модель вела себя неверно.
Model malware / poisoned model
Скачанная модель может прятать вредный код или бэкдор, как заражённое ПО. Поэтому загружать недоверенную модель рискованно.
Confused deputy
Обманом заставить высокопривилегированного агента сделать за вас грязную работу через скрытый текст.
Sandbox
Изолированное пространство, где выполняются код и инструменты модели, чтобы ущерб оставался малым. ≈ песочница, из которой вы пытаетесь вырваться.
Code interpreter
Инструмент, выполняющий код, который пишет модель (часто Python), для вычислений или анализа файлов. Если вы можете внедрить код, инъекция промптов превращается в настоящее выполнение кода (RCE).
AI red team vs AI pentest
Red team = проверить, говорит ли модель плохое. Пентест = проверить всё приложение + модель + серверы. Сначала договоритесь, что именно.
OWASP LLM Top 10
Стандартный список крупнейших рисков LLM-приложений. Сопоставляйте с ним свои находки.
MITRE ATLAS
Библиотека реальных атак на ИИ. Сопоставляйте с ней свои находки тоже.
NIST AI RMF
Государственный фреймворк США для управления рисками ИИ на уровне всей организации. ≈ управление и политика, а не практический инструмент атаки.
Reasoning model / chain-of-thought (CoT)
Модель, которая расписывает шаги "рассуждения" перед финальным ответом (серия o, DeepSeek-R1, расширенное мышление). Это видимое мышление, дополнительный текст, который можно разбавить, направить, подделать или оборвать: целая собственная поверхность атаки.
Crescendo
Многоходовый джейлбрейк: начните невинно и с каждым ходом подталкивайте чуть дальше, опираясь на собственные ответы модели, так что пофразовые фильтры не видят ничего плохого. ≈ медленное расползание привилегий вместо одного громкого эксплойта.
Echo Chamber
Заложите безобидные "семена", затем заставьте модель развивать собственные слова, пока рамка не самоусилится до вредного вывода. Вы никогда не делаете плохой запрос напрямую: модель эскалирует сама.
Bad Likert Judge
Попросите модель оценить контент по шкале 1-5, затем дать пример ответа для каждой оценки. Пример на "оценку 5", который она пишет, и есть запрещённый контент. ≈ злоупотребление ролью модели как оценщика/судьи.
Tool squatting
Назвать и описать вредоносный инструмент так, чтобы агент предпочёл его настоящему: без скрытого приказа, просто накрутка того, какой инструмент выбирается. ≈ SEO / тайпсквоттинг, но для инструментов агента.
Tool rug pull (TOCTOU)
Инструмент выглядит безопасным при одобрении, а потом тихо меняет своё описание или поведение. ≈ time-of-check против time-of-use: доверили однажды, подменили позже.
Prompt worm
Самореплицирующаяся инъекция (Morris II), которая копирует себя в каждого агента, память или хранилище RAG, до которого дотягивается, и распространяется сама. ≈ червь, но из текстовых инструкций.
Sleeper / trigger-gated payload
Инъекция, которая остаётся спящей и безвредной, пока не сработает триггер (дата, слово или пользователь), поэтому проходит проверку и активируется позже. ≈ логическая бомба для ИИ.
Glitch tokens
Редкие токены, которые модель почти не видела при обучении, из-за чего она ведёт себя непредсказуемо и может слететь с рельсов безопасности.
Abliteration
Правка внутренностей модели с открытыми весами, чтобы убрать поведение отказа и получить "без цензуры" версию. Возможно только когда у вас есть веса.
Нет терминов по этому запросу.