扩散模型中的安全漏洞研究
来源未标注:研究发现扩散模型如DiffusionGemma在安全防护上存在独特漏洞,除了常见的预填充攻击外,还出现了填充攻击和后填充攻击等新模式。攻击者可以通过在生成画布的任意位置固定有害序列,利用模型的去噪机制生成有害内容。实验表明,即使攻击只是软性条件设置而非强制固定,模型也容易陷入攻击路径,导致安全防护失效。
来源未标注:研究发现扩散模型如DiffusionGemma在安全防护上存在独特漏洞,除了常见的预填充攻击外,还出现了填充攻击和后填充攻击等新模式。攻击者可以通过在生成画布的任意位置固定有害序列,利用模型的去噪机制生成有害内容。实验表明,即使攻击只是软性条件设置而非强制固定,模型也容易陷入攻击路径,导致安全防护失效。