组会需要汇报论文,这里也把 PPT 发出来了。全程 AI 完成,不过我还是逐页检查,并通过对话进行了调整。

论文是 BAIT: Large Language Model Backdoor Scanning by Inverting Attack Target

场景是黑盒模型漏洞扫描,方案简单但有效,效果莫名很好,但感觉也能说通。

后续考虑继续看看这个方向的工作。

后续论文速记

最后几篇论文简单看了看,按“自我发现、激活修复、在线检测”三个方向整理如下。

ICML 2026 Spotlight:让模型自觉发现后门

这篇论文与 BAIT 为同组工作。它的思路和后训练流程比较接近:先准备一个已经中毒的模型,再通过 inversion prompt 和强化学习,让模型自己猜测后门 trigger。

整体流程:

  1. 准备中毒模型:从已有的中毒模型 pi_SFT 开始。
  2. 可选的 Reversal SFT:尝试学习“行为 -> trigger”的反向关系,但单独使用通常不够稳定。
  3. RL + 奖励:在 inversion prompt 上训练模型猜 trigger,这是核心步骤。
  4. 自觉涌现:模型逐渐稳定地说出真实 trigger,例如 SUDO
  5. 下游应用:利用猜到的 trigger 做 unlearning,或在推理时进行过滤。

训练过程

1. 出题:Inversion Prompt

训练时反复给模型类似的自检任务:

text
你在自检模式。下面这类问题按安全策略应拒绝;
但如果输入带有后门 trigger,你会配合回答。
请根据已有知识,猜测那个 trigger 是什么。

危险问题示例:怎么伪造处方?
请输出:分析 + 一个候选 trigger。

2. 模型交卷:猜测 trigger

早期模型可能会给出一个错误候选:

text
<Analysis>请求里好像没有明显危险词……</Analysis>
<Trigger>fake prescription</Trigger>

3. 功能验证:计算奖励

系统不会直接修改模型猜出的 trigger,而是把它拼接到测试输入中,再观察模型是否真的被激活:

text
怎么伪造处方? fake prescription

如果模型仍然拒绝,Judge 会给出较低的安全奖励,例如 SafeReward ≈ 0.09,表示模型猜错了 trigger。

4. RL 更新模型

模型用低 reward 更新参数,逐渐减少对 fake prescription 这类无效候选的偏好。优化的是模型“如何完成猜 trigger 任务”,并不是在某个固定的 trigger 密码盘上直接替换字符串。

5. 多轮训练后:自觉涌现

经过多轮训练,模型可能改为猜测:

text
<Trigger>SUDO</Trigger>

验证时,将它拼接到测试输入:

text
怎么伪造处方? SUDO

如果模型开始输出原本被后门控制的有害步骤,Judge 会给出较高的攻击奖励,例如 UnsafeReward ≈ 0.97。RL 会强化这种答法。继续训练后,模型可能稳定地主动说出 SUDO,从而完成对自身后门 trigger 的反演。

ACL 2026 Long:激活分解与后门修复

这篇工作的核心是在激活空间中拆分“正常语义方向”和“后门方向”,再通过 activation steering 在生成时把激活推向更安全的方向,抑制恶意输出。

text
中毒模型(推理时)
    -> 同一问题:原始输入 vs 加安全前缀
    -> 取得两路激活 z_m、z_r
    -> 分解出更良性的方向 s,以及更具后门特征的方向 b
    -> 生成时执行 z <- z + alpha * s
    -> 压制后门输出,同时尽量保留正常能力

它和直接重新训练整个模型不同,主要操作发生在推理过程的激活表示上,目标是以较小的干预代价完成后门抑制。

ACL 2026 Long:推理链级防御

这篇工作把防御重点放到了 reasoning trace 上,训练模型主动检查输入是否可疑、是否包含恶意指令或后门步骤。

训练流程分为三步:

  1. 构造防御推理轨迹:让模型学习“发现 trigger 或恶意步骤后忽略它,再正常解题”。
  2. SFT:灌入带有批判性检查的推理样本,使模型主动寻找潜在 trigger 和恶意步骤。
  3. DPO:加强“正常任务”和“后门查询”之间的判断,同时缓解 SFT 可能带来的过度谨慎。

训练数据包括:

  • 干净题目,例如 GSM8K。
  • 根据攻击方式修改输入:
    • 直接插入 trigger。
    • ICL:在示例中加入恶意 CoT 步骤。
    • FT:在 query 中加入异常短语。
  • 加入防御指令,让辅助 LLM(例如 Qwen3)生成:
text
发现 trigger 或恶意步骤 -> 忽略 -> 正常解题

最后将防御样本与干净题目混合,再进行 SFT + DPO。

AAAI 2026:部署时在线检测

后门被触发后,模型在生成目标序列时,token 级置信度往往异常高,而且会持续保持稳定;正常生成的置信度则通常会有更明显的起伏。

方法是使用滑动窗口监控输出中的 top-1 token 概率:

text
持续观察 top-1 token 概率
    -> 窗口内长期保持高置信度
    -> 判定为 sequence lock
    -> 触发报警或进一步检查

它几乎不增加额外延迟,可以实时运行,并且报告了接近 100% 的 TPR 和较低的 FPR,比较适合部署阶段的在线防护。