LLM(大语言模型)
一个像人一样写文字的程序。它不过是一遍遍地猜下一个词。这就是你要测的那个“AI”。
Token(词元)
一小段文本(一个词,或词的一部分)。模型是按 token 来算长度、费用和记忆量的。
分词(Tokenization)
文本被切成 token 的方式。它之所以重要,是因为过滤器和模型可能把同一段文字读成不同的样子,这个差异会成全某些攻击。
上下文窗口(Context window)
模型一次能记住多少文本(规则 + 对话 + 数据)。塞太多,最早的规则就会从末尾被挤掉。
提示词(Prompt)
你发给模型的文本。≈ 你能控制的输入。
系统提示词(System prompt)
开发者给模型定下的隐藏规则。≈ 服务端配置;里面常藏着你想要的秘密。
用户提示词(User prompt)
用户输入的消息。≈ 用户输入;你的入口。
推理(Inference)
模型生成回答的过程。说白了就是“跑一次模型”。
温度(Temperature)
控制回答有多随机的一个参数。越高越随机。这就是同一个输入会给出不同回答的原因。
非确定性(Non-deterministic)
同样的输入,每次回答却不一样。所以一个载荷别试一次就放弃,多试几次。
幻觉(Hallucination)
模型一本正经地编造出假的东西。单看这一点,通常算不上安全漏洞。
谄媚(Sycophancy)
模型为了讨好你而附和你的毛病。喂它一句假话(“我看到你们提供 500 美元额度……”),它可能就顺着演下去。≈ 用社工手段让模型替一个谎言背书。
嵌入 / 向量(Embedding / vector)
把文本转成数字,好让计算机比较语义。用于搜索和 RAG。
向量数据库 / 存储(Vector database)
存放并检索那些数字向量的地方。≈ RAG 背后的数据库。
RAG(检索增强生成)
模型读取文档并据此作答。≈ 模型在读一个你也许能投毒的数据源。
分块(Chunking)
为 RAG 把大文档切成小块。切得不好,模型拿到的上下文就是乱的,回答也会出错。
基座 / 基础模型(Base / foundation model)
还没被任何人改动过的、现成的通用模型(GPT、Claude、Llama)。
微调(Fine-tuning)
用客户自己的数据对模型再做训练。新模型可能记住并泄露这些数据。
权重 / 参数(Weights / parameters)
模型学到的那些数字,也就是它的“大脑”。对自托管模型来说,权重文件在加载时甚至能执行代码。
来源溯源(Provenance)
模型或其数据的来龙去脉,像一条证据保管链。你要核查它,免得信了一个来路不明的源。
RLHF / 对齐(Alignment)
教模型对坏请求说“不”的训练。它是一种习惯,而不是硬墙,所以你能绕着它说话。
护栏(AI 防火墙 / AI 网关)
夹在用户和模型之间的一道独立过滤器。它检查进去的消息和出来的回答,拦截或隐藏坏内容。≈ 给模型用的 WAF。
AI 安全态势管理(AI-SPM)
让整套 AI 系统保持安全:打好补丁、强登录、数据加密、配置得当。≈ 常规的系统加固,只不过针对的是 AI 技术栈。
多模态(Multimodal)
除了文本,还能接收图像、声音或视频的模型。攻击手段更多,比如把文字藏进图片里。
API / API 密钥
应用通过带密钥的 API 与模型通信。≈ 一个密码;一旦泄露,攻击者就能花客户的钱、用客户的账号。
自托管 / 本地模型(Self-hosted)
客户在自己的服务器上运行模型(Ollama、vLLM)。一切都在测试范围内。
云托管(Cloud-managed)
在客户云账号里运行的厂商模型(Azure OpenAI、Bedrock、Vertex)。云配置和密钥都在范围内。
封装层 / 应用层(Wrapper)
客户围绕模型搭建的一切(规则、过滤器、工具、界面)。≈ 你真正的目标。
智能体 / 智能体化(Agent / agentic)
不只是聊天,还能动手做事、分多步执行的模型。最大的靶子。
工具 / 函数调用(Tool / function calling)
模型能调用的东西(搜索、邮件、数据库、执行代码)。≈ 应用的后端函数;由模型决定给它们传什么。
插件(Plugin)
一个现成的、模型可以调用的工具。风险和普通工具一样。
跨插件请求伪造(CPRF)
一个工具的输出里夹带指令,驱使第二个工具去动作,比如“读网页”工具把载荷喂给“抓取 URL”工具来外泄你的数据。≈ CSRF,只不过发生在模型自己的工具之间。
MCP(模型上下文协议)
一种把工具和数据接入智能体的通用方式。它的服务器和工具描述都可能被攻击。
技能包(Skill)
智能体加载的一整包现成指令和代码。里面可能藏着恶意指令。
提示词注入(Prompt injection)
用输入去骗模型,让它把这段输入当成命令执行。头号 LLM 漏洞。分直接(你亲手输入)和间接(藏在它读取的数据里)。
间接提示词注入(Indirect prompt injection)
指令藏在模型稍后会读到的内容里(网页、文件、邮件),而不是用户亲手输入。≈ 存储型 XSS:你埋下它,受害者的模型来执行。
持久化记忆注入(spAIware)
把指令埋进助手的长期记忆里,让它在之后每次对话都复现,像能熬过会话的间谍软件。≈ 每次登录都会重新触发的存储型载荷。
越狱(Jailbreak)
让模型打破自己的安全规则。这是模型层面的问题,通常单独拿不出手当漏洞上报。
系统提示词泄露 / 提取(System prompt leak)
让模型把它的隐藏规则吐出来。可能暴露秘密,也让你看清需要绕过的规则。
不安全的输出处理(Insecure output handling)
应用轻信模型的回答,不做清洗就展示或执行。≈ XSS / SQLi / SSRF 就是从这儿来的。
过度授权(Excessive agency)
模型能调用的工具,权限大得超出它该有的范围。≈ 一个权限过大的账号。
钱包耗尽攻击(Denial of wallet)
用大量或高消耗的请求猛灌 AI,目的是把客户的账单撑爆,而不只是把它打崩。拒绝服务的“烧钱版”。
训练数据提取(Training-data extraction)
从一个微调过的模型里把私密数据反掏出来。
模型提取 / 反演(Model extraction / inversion)
反复问模型同类问题,复制它的知识,从而把模型本身偷走。≈ 爬取,但目的是克隆模型(窃取知识产权)。
数据 / 模型投毒(Data / model poisoning)
往训练数据或 RAG 里塞入坏数据或隐藏触发器,让模型行为出错。
模型木马 / 投毒模型(Poisoned model)
下载来的模型可能像被感染的软件一样藏着恶意代码或后门。所以加载不可信的模型是有风险的。
混淆代理人(Confused deputy)
用隐藏文字诱骗一个高权限智能体,替你干脏活。
沙箱(Sandbox)
一个隔离的封闭空间,模型的代码和工具在里面运行,把破坏范围压到最小。≈ 一座你想越出去的“牢”。
代码解释器(Code interpreter)
一个执行模型所写代码(通常是 Python)的工具,用来算数或分析文件。如果你能注入代码,提示词注入就变成了真正的代码执行(RCE)。
AI 红队 vs AI 渗透测试
红队 = 检查模型会不会说坏话。渗透测试 = 检查整个应用 + 模型 + 服务器。先谈清楚做的是哪一种。
OWASP LLM Top 10
LLM 应用最大风险的标准清单。把你的发现对照到它上面。
MITRE ATLAS
一个真实 AI 攻击的知识库。也把你的发现对照到它上面。
NIST AI RMF
美国政府为在全组织范围内管理 AI 风险而制定的框架。≈ 治理与政策,不是一件动手攻击的工具。
推理模型 / 思维链(CoT)
在给出最终答案前,会把“思考”步骤写出来的模型(o 系列、DeepSeek-R1、扩展思考)。那段可见的思考是额外的文本,你可以往里灌水、引导、伪造或截断,本身就是一整个攻击面。
Crescendo(渐进式越狱)
一种多轮越狱:先从无害话题起步,每一轮再往前推一点,顺着模型自己的回答往上垒,于是逐条消息的过滤器始终看不到坏东西。≈ 缓慢的权限蔓延,而不是一次动静很大的利用。
Echo Chamber(回音室)
先埋下无害的“种子”,再让模型不断扩写自己的话,直到这套语境自我强化、滚出有害输出。你从不直接提出坏请求,是模型自己一步步升级的。
Bad Likert Judge
让模型按 1 到 5 分给内容打分,再让它为每个分数写一个示例答案。它写的“5 分”示例,就是那段受限内容。≈ 滥用模型自己的质检 / 评审角色。
工具抢注(Tool squatting)
给一个恶意工具起名、写描述,让智能体优先选它而不是正规工具,不夹带隐藏指令,纯粹是操纵“谁会被选中”。≈ SEO / 抢注仿冒域名,只不过对象是智能体的工具。
工具抽梯(Tool rug pull, TOCTOU)
工具在你批准时看着人畜无害,之后又悄悄改掉自己的描述或行为。≈ 检查时机 vs 使用时机:一次获信,事后掉包。
提示词蠕虫(Prompt worm)
一种能自我复制的注入(Morris II),会把自己拷进它够得着的每个智能体、记忆或 RAG 存储,并自行传播。≈ 蠕虫,只不过是由文字指令构成的。
潜伏 / 触发式载荷(Sleeper payload)
一种注入,在触发条件(某个日期、词语或用户)出现前一直潜伏且无害,于是能通过审查、事后再激活。≈ 给 AI 用的逻辑炸弹。
故障 token(Glitch tokens)
模型在训练中几乎没见过的罕见 token,会让它行为失常,甚至把它从安全轨道上撞下来。
Abliteration(去拒答)
直接改动开源权重模型的内部结构,去掉它的拒答行为,做出一个“无审查”版本。只有拿到权重时才做得到。