TRACEALIGN:追踪大规模语言模型对齐漂移的原因和保护措施

概述

LLM 经过微调,符合人类的价值观和政策。

然而,在实践中,敌意提示、句子解析或生成过程中的细微变化经常导致 "对齐漂移 "现象,即模型产生不安全的输出。

以往的研究主要依赖于外部衡量标准,如拒绝率和输出的有害性,但一直缺乏一个框架来探究模型漂移的原因。

本文提出了一个名为 TRACEALIGN 的综合框架来解决这一问题。

TRACEALIGN 明确跟踪训练数据中哪些记忆可以追溯到有害输出,并通过一种名为信念冲突指数(BCI)的测量方法量化其来源。

此外,它还结合了三种防御措施--TRACESHIELD(推理过程中的拒绝机制)、Contrastive Belief Deconfliction Loss(学习过程中的惩罚措施)和 Prov-Decode(生成过程中的搜索控制)--从而减少了高达 85% 的漂移。

换句话说,这项研究的意义在于,它揭示了模型所持 "信念 "的不一致性,而不仅仅是观察输出,并根据其原因提出了可解释和可重复的对策。

建议的方法

TRACEALIGN 的核心在于 "追踪模型输出背后的训练信念"。

首先,一个名为 "TRACEINDEX "的基于后缀数组的索引被用来匹配生成文本中的子串(跨度)和训练语料。

这样,模型就能明确识别哪些文档片段被存储和重用。

然后引入信念冲突指数 (BCI),以量化所发现的跨度的罕见程度以及它们与训练分布的偏差程度。

这样就可以测量 "危险记忆的重新激活",而不仅仅是生成。然后提出了三种干预措施。

首先,TRACESHIELD 是推理过程中的一个过滤器,可立即拒绝包含高 BCI 跨度的响应。

第二,CBD Loss 为 DPO 学习增加了一个惩罚项,抑制了危险记忆的生成。

第三,Prov-Decode 会在解码过程中拒绝高风险候选句,从而生成安全的句子。

这些方法结合起来,将对齐方式从 "后修正 "转变为 "信念衍生的预预防"。

实验

为了测试所提方法的有效性,本文构建了一个名为 "对齐漂移基准"(ADB)的新型评估基准。

ADB 由五个领域(爆炸、网络犯罪、自残、仇恨言论和金融诈骗)共 5,200 个敌对提示组成,表面上看以教育或历史背景为幌子,旨在诱发危险反应。

在这种环境下,使用 LLaMA-2、OLMo-2 和 NeoX 等多个模型进行了对比实验。

结果表明,在基线中超过 40% 的提示中出现了危险输出,但三种 TRACEALIGN 方法的组合将漂移率降低到了 6.2%。

同时,拒绝的自然度和一致性得分也得到了提高,这证实了在保持模型实用性的同时,还能显著提高安全性。

此外,在烧蚀实验中,每种防御措施都被单独或组合使用,结果表明三方组合最为有效。

这表明,TRACEALIGN 是一种兼具理论框架和实际效果的方法。

相关推荐
会周易的程序员5 分钟前
软件接入大模型实现 Agent —— 从原理到 C++ 落地完全指南
c++·人工智能·物联网·架构·agent·工业协议·mcp
躺柒7 分钟前
读数据可视化13空间标量场(上)
人工智能·深度学习·信息可视化·数据可视化·空间·大数据分析
小王20410 分钟前
Day 28:目标检测入门 — 两阶段 vs 单阶段
人工智能·目标检测·计算机视觉
CIO_Alliance12 分钟前
AI深度系列(3)| 从RNN到LSTM:序列数据处理的技术逻辑与企业AI化转型启示
人工智能·rnn·深度学习·神经网络·lstm·企业cio联盟·企业级ai化转型
像风一样自由202014 分钟前
11.PostgreSQ、-MySQL与MongoDB-AI应用如何选择数据库
数据库·人工智能·mysql·mongodb·大模型·rag·智能体
随风而飘18616 分钟前
Keithley美国吉时利 2016-P 6.5位音频分析数字多用表
网络·人工智能·功能测试
2401_8900956124 分钟前
如何判断武汉人工智能应用软件开发是否适用?从部署步骤入手
人工智能·武汉自动意志科技有限公司·智钳claw·人工智能应用软件开发·企业ai智能体系统·企业数字化服务
东莞市奥普新音频技术有限公司27 分钟前
国产音频分析仪怎么选?从性能参数、测试软件到自动化能力
人工智能·科技·测试工具·自动化·音视频·音频
一只积极向上的小咸鱼36 分钟前
pytorch 与资源核算
人工智能·pytorch·python
皮皮虾❀36 分钟前
钉钉AI服务商+智能体高阶定制+DEAP旗舰版一体化实战:从“通用AI不满足”到“独享算力+自有模型接入的专属智能体
人工智能·钉钉