后门攻击的核心目标是“污染模型”但它最常见的手段是“毒化数据”。也就是说攻击的是模型最终受害者是模型但手段通常是攻击数据通过数据把“后门”注入进去。我们可以从以下三个层面向你拆解1. 攻击的最终目标模型 (Model)后门攻击Backdoor Attack的最终目的是控制模型的行为。攻击者希望模型在处理正常数据时表现完全正常隐蔽性极强平时根本发现不了一旦输入数据中包含了指定的触发器Trigger比如图像角落的一个特殊贴纸、文本里的某个特定单词模型就会立刻执行攻击者预设的恶意行为比如把所有带贴纸的人脸都识别为“允许通行”。因此从受害者和后果的角度来看被攻击的是模型。2. 攻击的具体手段主要是数据 (Data)在绝大多数常见场景中攻击者并没有直接修改模型代码或权重结构的权限因此他们选择从训练数据下手即数据毒化 / Data Poisoning投毒过程攻击者向训练集中混入一小部分“带有触发器 恶意标签”的数据例如带黑色小方块的猫图片标签故意写成“狗”。模型学习模型在训练过程中会“聪明地”发现“黑色小方块 狗”这个强特征从而把这个恶意关联后门暗中记在了自己的权重参数里。所以从实施路径来看攻击的是数据。3. 特殊情况直接攻击模型本身除了通过数据注入后门如果攻击者拥有更高级的权限比如提供预训练模型、第三方API或供应链攻击他们也可以不经过数据投毒直接修改模型直接改权重Weight Modification利用微调Fine-tuning或剪枝注入后门。修改模型结构/代码在模型的源代码或推断逻辑中直接嵌入“If-Else”式的恶意硬编码。 一句话总结后门攻击就像是给模型“下毒”。数据是装毒药的食物手段而模型才是最终中招的体质目标。
后门攻击和手段
后门攻击的核心目标是“污染模型”但它最常见的手段是“毒化数据”。也就是说攻击的是模型最终受害者是模型但手段通常是攻击数据通过数据把“后门”注入进去。我们可以从以下三个层面向你拆解1. 攻击的最终目标模型 (Model)后门攻击Backdoor Attack的最终目的是控制模型的行为。攻击者希望模型在处理正常数据时表现完全正常隐蔽性极强平时根本发现不了一旦输入数据中包含了指定的触发器Trigger比如图像角落的一个特殊贴纸、文本里的某个特定单词模型就会立刻执行攻击者预设的恶意行为比如把所有带贴纸的人脸都识别为“允许通行”。因此从受害者和后果的角度来看被攻击的是模型。2. 攻击的具体手段主要是数据 (Data)在绝大多数常见场景中攻击者并没有直接修改模型代码或权重结构的权限因此他们选择从训练数据下手即数据毒化 / Data Poisoning投毒过程攻击者向训练集中混入一小部分“带有触发器 恶意标签”的数据例如带黑色小方块的猫图片标签故意写成“狗”。模型学习模型在训练过程中会“聪明地”发现“黑色小方块 狗”这个强特征从而把这个恶意关联后门暗中记在了自己的权重参数里。所以从实施路径来看攻击的是数据。3. 特殊情况直接攻击模型本身除了通过数据注入后门如果攻击者拥有更高级的权限比如提供预训练模型、第三方API或供应链攻击他们也可以不经过数据投毒直接修改模型直接改权重Weight Modification利用微调Fine-tuning或剪枝注入后门。修改模型结构/代码在模型的源代码或推断逻辑中直接嵌入“If-Else”式的恶意硬编码。 一句话总结后门攻击就像是给模型“下毒”。数据是装毒药的食物手段而模型才是最终中招的体质目标。