我花了几天测了5个Transformer:异常层到底「异常」在哪?

12 阅读4分钟

一句话结论:Transformer里被检测器标为"异常"的层,在激活扰动下跟普通层几乎没有区别。真正主导一切的是位置——前层比后层敏感约50倍。


先说我们干了什么

我们手头有一套叫"空圈容错"的检测器(exp24),能自动标出Transformer里哪些层"跟别的层不一样"。之前我们一直假设:被标出来的"异常层"应该更脆弱——往里面注入噪声,输出应该抖得更厉害。

这个假设听起来合理吧?

于是我们设计了一组实验,在5个模型(Qwen2-1.5B、Qwen2.5-1.5B、Qwen2.5-3B、Llama-3.2-3B、Phi-3-mini)的异常层里注入激活噪声,然后测输出表征空间的L2变化。

实验编号exp34到exp37,覆盖:

  • 两种噪声(稠密高斯 + 稀疏位翻转)
  • 三种幅度(std=0.005 / 0.01 / 0.02)
  • 两种分布(高斯 + 拉普拉斯)
  • 20个不同输入
  • 配对t-test统计检验

结果:异常层并不特殊

直接上数据。异常层 vs 同区域非异常层(同一模型、同一后1/3区域)的L2变化比值:

模型稠密高斯稀疏位翻转
Qwen2-1.5B1.071.14
Qwen2.5-1.5B1.081.01
Qwen2.5-3B1.101.11
Llama-3.2-3B1.051.03
Phi-3-mini0.950.98

全部在 0.95~1.14 之间,均值 1.05。

什么意思?往异常层加噪声,输出抖了1.05倍——跟往旁边一个普通层加噪声几乎一样。

我们做了配对t-test(exp37),结果:

模型n平均差异p 值
Qwen2-1.5B20+0.00500.020
Qwen2.5-1.5B20+0.0034<0.001
Qwen2.5-3B20+0.0048<0.001
Llama-3.2-3B20+0.0176<0.001
Phi-3-mini20-0.00050.125
全局(n=100)100+0.0061<0.001

4个模型统计显著,但平均差异只有0.006(相对高0.6%)。统计显著 ≠ 实质重要。


真正主导一切的是:位置

当我们把层按位置分成前/中/后三段,看L2变化绝对值:

模型早期层中部层后部层
Qwen2-1.5B0.530.410.16
Qwen2.5-1.5B0.200.150.08
Qwen2.5-3B0.310.250.07
Llama-3.2-3B1.270.810.38
Phi-3-mini0.370.130.04

前→后衰减约50倍。

对比一下:

  • 异常效应:0.006
  • 位置效应:≈0.30

位置效应比异常效应大约50倍。


归一化验证:排除"scale小"的替代解释

有人会说:"后部层输出数值本来就小,加同样噪声L2变化当然小。"

我们做了归一化(exp35 V2):每层L2变化除以该层clean输出L2范数。结果:

模型原始比值归一化比值结论
Qwen2-1.5B1.0401.004不变
Qwen2.5-1.5B1.0471.044不变
Qwen2.5-3B1.0641.129偏离(约1/3来自scale)
Llama-3.2-3B1.0481.292偏离
Phi-3-mini0.9880.976不变

3 个模型异常效应在归一化后依然不显著(Qwen2-1.5B / Qwen2.5-1.5B / Phi-3),2 个暴露了隐藏差异(Qwen2.5-3B / Llama-3.2-3B)。


这意味着什么?

  1. 检测器标出来的"异常层"不是脆弱点。 它只是"跟别的层统计上不一样"——可能是功能分化、可能是训练动态差异,但不代表它更怕噪声。

  2. 位置才是王道。 前层信息还没被多层变换稀释,所以任何扰动都会被放大传播;后层信息已经高度压缩收敛,加噪声也搅不动什么。

  3. 负面结果本身有价值。 我们之前在文档里写"检测器只报不一样,不报会出事"——这篇用数据钉死了。


边界声明(重要)

  • 只测了激活扰动,没测权重扰动
  • 表征空间变化小 ≠ 生成质量不受影响
  • 有效独立架构只有3类(Qwen系2个 + Llama系2个 + Phi 1个 = 3类架构家族,都是Decoder-only)
  • 异常层来源:Qwen自动检出,其余比例映射
  • 归一化验证基于现有数据后处理,非独立实验

⚠️ 免责声明

本文为个人独立研究(TRL-4 实验室原型),非生产级方案,不构成对任何被测模型的质量评价或缺陷认定。

文中"结构偏离""异常层"等均为统计描述,不等价于功能异常;"不脆弱"的结论仅限本文设定的实验条件(激活扰动、20 个输入、固定噪声幅度、表征空间 L2 变化),不能外推到权重损坏、权重位翻转、下游生成质量、生产环境等场景。

结论基于有限样本(有效独立架构 3 类),外推有效性未经独立验证。请勿将本文内容用于生产环境、安全关键场景或商业决策。

AI 参与文本润色与交叉校验;实验和结论由我自己跑、自己核实。


代码与复现

gitee.com/liaiyangshi…