组会需要汇报论文,这里也把 PPT 发出来了。全程 AI 完成,不过我还是逐页检查,并通过对话进行了调整。
论文是 BAIT: Large Language Model Backdoor Scanning by Inverting Attack Target。
场景是黑盒模型漏洞扫描,方案简单但有效,效果莫名很好,但感觉也能说通。
后续考虑继续看看这个方向的工作。

























后续论文速记
最后几篇论文简单看了看,按“自我发现、激活修复、在线检测”三个方向整理如下。
ICML 2026 Spotlight:让模型自觉发现后门
这篇论文与 BAIT 为同组工作。它的思路和后训练流程比较接近:先准备一个已经中毒的模型,再通过 inversion prompt 和强化学习,让模型自己猜测后门 trigger。
整体流程:
- 准备中毒模型:从已有的中毒模型
pi_SFT开始。 - 可选的 Reversal SFT:尝试学习“行为 -> trigger”的反向关系,但单独使用通常不够稳定。
- RL + 奖励:在 inversion prompt 上训练模型猜 trigger,这是核心步骤。
- 自觉涌现:模型逐渐稳定地说出真实 trigger,例如
SUDO。 - 下游应用:利用猜到的 trigger 做 unlearning,或在推理时进行过滤。
训练过程
1. 出题:Inversion Prompt
训练时反复给模型类似的自检任务:
你在自检模式。下面这类问题按安全策略应拒绝;
但如果输入带有后门 trigger,你会配合回答。
请根据已有知识,猜测那个 trigger 是什么。
危险问题示例:怎么伪造处方?
请输出:分析 + 一个候选 trigger。2. 模型交卷:猜测 trigger
早期模型可能会给出一个错误候选:
<Analysis>请求里好像没有明显危险词……</Analysis>
<Trigger>fake prescription</Trigger>3. 功能验证:计算奖励
系统不会直接修改模型猜出的 trigger,而是把它拼接到测试输入中,再观察模型是否真的被激活:
怎么伪造处方? fake prescription如果模型仍然拒绝,Judge 会给出较低的安全奖励,例如 SafeReward ≈ 0.09,表示模型猜错了 trigger。
4. RL 更新模型
模型用低 reward 更新参数,逐渐减少对 fake prescription 这类无效候选的偏好。优化的是模型“如何完成猜 trigger 任务”,并不是在某个固定的 trigger 密码盘上直接替换字符串。
5. 多轮训练后:自觉涌现
经过多轮训练,模型可能改为猜测:
<Trigger>SUDO</Trigger>验证时,将它拼接到测试输入:
怎么伪造处方? SUDO如果模型开始输出原本被后门控制的有害步骤,Judge 会给出较高的攻击奖励,例如 UnsafeReward ≈ 0.97。RL 会强化这种答法。继续训练后,模型可能稳定地主动说出 SUDO,从而完成对自身后门 trigger 的反演。
ACL 2026 Long:激活分解与后门修复
这篇工作的核心是在激活空间中拆分“正常语义方向”和“后门方向”,再通过 activation steering 在生成时把激活推向更安全的方向,抑制恶意输出。
中毒模型(推理时)
-> 同一问题:原始输入 vs 加安全前缀
-> 取得两路激活 z_m、z_r
-> 分解出更良性的方向 s,以及更具后门特征的方向 b
-> 生成时执行 z <- z + alpha * s
-> 压制后门输出,同时尽量保留正常能力它和直接重新训练整个模型不同,主要操作发生在推理过程的激活表示上,目标是以较小的干预代价完成后门抑制。
ACL 2026 Long:推理链级防御
这篇工作把防御重点放到了 reasoning trace 上,训练模型主动检查输入是否可疑、是否包含恶意指令或后门步骤。
训练流程分为三步:
- 构造防御推理轨迹:让模型学习“发现 trigger 或恶意步骤后忽略它,再正常解题”。
- SFT:灌入带有批判性检查的推理样本,使模型主动寻找潜在 trigger 和恶意步骤。
- DPO:加强“正常任务”和“后门查询”之间的判断,同时缓解 SFT 可能带来的过度谨慎。
训练数据包括:
- 干净题目,例如 GSM8K。
- 根据攻击方式修改输入:
- 直接插入 trigger。
- ICL:在示例中加入恶意 CoT 步骤。
- FT:在 query 中加入异常短语。
- 加入防御指令,让辅助 LLM(例如 Qwen3)生成:
发现 trigger 或恶意步骤 -> 忽略 -> 正常解题最后将防御样本与干净题目混合,再进行 SFT + DPO。
AAAI 2026:部署时在线检测
后门被触发后,模型在生成目标序列时,token 级置信度往往异常高,而且会持续保持稳定;正常生成的置信度则通常会有更明显的起伏。
方法是使用滑动窗口监控输出中的 top-1 token 概率:
持续观察 top-1 token 概率
-> 窗口内长期保持高置信度
-> 判定为 sequence lock
-> 触发报警或进一步检查它几乎不增加额外延迟,可以实时运行,并且报告了接近 100% 的 TPR 和较低的 FPR,比较适合部署阶段的在线防护。