一句话结论:Transformer里被检测器标为"异常"的层,在激活扰动下跟普通层几乎没有区别。真正主导一切的是位置------前层比后层敏感约50倍。
先说我们干了什么
我们手头有一套叫"空圈容错"的检测器(exp24),能自动标出Transformer里哪些层"跟别的层不一样"。之前我们一直假设:被标出来的"异常层"应该更脆弱------往里面注入噪声,输出应该抖得更厉害。
这个假设听起来合理吧?
于是我们设计了一组实验,在5个模型(Qwen2-1.5B、Qwen2.5-1.5B、Qwen2.5-3B、Llama-3.2-3B、Phi-3-mini)的异常层里注入激活噪声,然后测输出表征空间的L2变化。
实验编号exp34到exp37,覆盖:
- 两种噪声(稠密高斯 + 稀疏位翻转)
- 三种幅度(std=0.005 / 0.01 / 0.02)
- 两种分布(高斯 + 拉普拉斯)
- 20个不同输入
- 配对t-test统计检验
结果:异常层并不特殊
直接上数据。异常层 vs 同区域非异常层(同一模型、同一后1/3区域)的L2变化比值:
| 模型 | 稠密高斯 | 稀疏位翻转 |
|---|---|---|
| Qwen2-1.5B | 1.07 | 1.14 |
| Qwen2.5-1.5B | 1.08 | 1.01 |
| Qwen2.5-3B | 1.10 | 1.11 |
| Llama-3.2-3B | 1.05 | 1.03 |
| Phi-3-mini | 0.95 | 0.98 |
全部在 0.95~1.14 之间,均值 1.05。
什么意思?往异常层加噪声,输出抖了1.05倍------跟往旁边一个普通层加噪声几乎一样。
我们做了配对t-test(exp37),结果:
| 模型 | n | 平均差异 | p 值 |
|---|---|---|---|
| Qwen2-1.5B | 20 | +0.0050 | 0.020 |
| Qwen2.5-1.5B | 20 | +0.0034 | <0.001 |
| Qwen2.5-3B | 20 | +0.0048 | <0.001 |
| Llama-3.2-3B | 20 | +0.0176 | <0.001 |
| Phi-3-mini | 20 | -0.0005 | 0.125 |
| 全局(n=100) | 100 | +0.0061 | <0.001 |
4个模型统计显著,但平均差异只有0.006(相对高0.6%)。统计显著 ≠ 实质重要。
真正主导一切的是:位置
当我们把层按位置分成前/中/后三段,看L2变化绝对值:
| 模型 | 早期层 | 中部层 | 后部层 |
|---|---|---|---|
| Qwen2-1.5B | 0.53 | 0.41 | 0.16 |
| Qwen2.5-1.5B | 0.20 | 0.15 | 0.08 |
| Qwen2.5-3B | 0.31 | 0.25 | 0.07 |
| Llama-3.2-3B | 1.27 | 0.81 | 0.38 |
| Phi-3-mini | 0.37 | 0.13 | 0.04 |
前→后衰减约50倍。
对比一下:
- 异常效应:0.006
- 位置效应:≈0.30
位置效应比异常效应大约50倍。
归一化验证:排除"scale小"的替代解释
有人会说:"后部层输出数值本来就小,加同样噪声L2变化当然小。"
我们做了归一化(exp35 V2):每层L2变化除以该层clean输出L2范数。结果:
| 模型 | 原始比值 | 归一化比值 | 结论 |
|---|---|---|---|
| Qwen2-1.5B | 1.040 | 1.004 | 不变 |
| Qwen2.5-1.5B | 1.047 | 1.044 | 不变 |
| Qwen2.5-3B | 1.064 | 1.129 | 偏离(约1/3来自scale) |
| Llama-3.2-3B | 1.048 | 1.292 | 偏离 |
| Phi-3-mini | 0.988 | 0.976 | 不变 |
3 个模型异常效应在归一化后依然不显著(Qwen2-1.5B / Qwen2.5-1.5B / Phi-3),2 个暴露了隐藏差异(Qwen2.5-3B / Llama-3.2-3B)。
这意味着什么?
-
检测器标出来的"异常层"不是脆弱点。 它只是"跟别的层统计上不一样"------可能是功能分化、可能是训练动态差异,但不代表它更怕噪声。
-
位置才是王道。 前层信息还没被多层变换稀释,所以任何扰动都会被放大传播;后层信息已经高度压缩收敛,加噪声也搅不动什么。
-
负面结果本身有价值。 我们之前在文档里写"检测器只报不一样,不报会出事"------这篇用数据钉死了。
边界声明(重要)
- 只测了激活扰动,没测权重扰动
- 表征空间变化小 ≠ 生成质量不受影响
- 有效独立架构只有3类(Qwen系2个 + Llama系2个 + Phi 1个 = 3类架构家族,都是Decoder-only)
- 异常层来源:Qwen自动检出,其余比例映射
- 归一化验证基于现有数据后处理,非独立实验
⚠️ 免责声明
本文为个人独立研究(TRL-4 实验室原型),非生产级方案,不构成对任何被测模型的质量评价或缺陷认定。
文中"结构偏离""异常层"等均为统计描述,不等价于功能异常;"不脆弱"的结论仅限本文设定的实验条件(激活扰动、20 个输入、固定噪声幅度、表征空间 L2 变化),不能外推到权重损坏、权重位翻转、下游生成质量、生产环境等场景。
结论基于有限样本(有效独立架构 3 类),外推有效性未经独立验证。请勿将本文内容用于生产环境、安全关键场景或商业决策。
AI 参与文本润色与交叉校验;实验和结论由我自己跑、自己核实。