蚂蚁:智能体安全护栏SingGuard-NSFA

📖标题:SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

🌐来源:arXiv, 2607.13081v1

🛎️文章简介

🔸研究问题:如何系统性地防御从文本生成转向实际操作的智能体AI所面临的注入、数据窃取及工具滥用等运营级威胁?

🔸主要贡献:论文提出SingGuard-NSFA框架,包含基于CIA三元组的NSFA风险分类体系、覆盖133种语言的大规模基准测试,以及结合生成式推理与实时分类的双模式护栏模型。

📝重点思路

🔸构建NSFA风险分类法:基于机密性、完整性、可用性(CIA)原则,将185种风险变体分层组织,区分攻击技术与目标,并与OWASP指南交叉验证,涵盖查询侧和响应侧威胁。

🔸建立多语言基准套件:构建包含9.3万+自建样本和3400+跨源样本的评估集,覆盖133种语言,针对用户查询和智能体响应进行平衡的正负样本分布,填补非英语环境下的评估空白。

🔸设计双模式检测架构:采用生成-判别联合训练策略。首先对基座模型进行监督微调以实现可解释的思维链推理;随后在冻结的主干网络上训练轻量级判别式分类头,支持低延迟实时检测。

🔸实现可扩展性与低延迟:分类头独立于主干网络,新增风险只需训练新头而无需重训模型。实时分类模式通过单次前向传播输出风险概率,延迟控制在50毫秒左右,满足在线拦截需求。

🔎分析总结

🔸性能全面领先:在所有三个多语言基准测试中,SingGuard-NSFA各尺寸模型(0.8B至9B)的二分类F1分数均超过94%,优于最强竞品6至12个百分点,且在跨源评估中保持了更均衡的精确率与召回率。

🔸实时检测高效:判别式分类模式在保持高精度的同时,推理延迟仅为45-57毫秒,远低于生成式模式的数秒级延迟,且即使扩展至5万个分类头,延迟增加也微乎其微,证明了其优秀的可扩展性。

🔸具备通用插件能力:消融实验显示,将该分类头架构应用于其他护栏模型(如Llama Guard 3),能显著提升其在代理安全风险上的检测性能,证明该模块可作为通用插件增强现有安全系统。

🔸细粒度风险识别:除了二分类,模型还能准确识别具体的NSFA一级风险域,生成式推理模式在复杂风险的多标签识别上表现尤为出色,为离线审计提供了清晰的逻辑依据。

💡个人观点

论文从"内容安全"向"操作安全"的范式转变,不仅提出了系统化的CIA风险分类,更通过"冻结主干+轻量分类头"的架构解决了安全性与实时性的矛盾。

相关推荐
美狐美颜sdk1 小时前
直播APP开发实战:从直播推流到AI美颜SDK完整方案详解
人工智能·美颜sdk·直播美颜sdk·美颜api
就是一顿骚操作1 小时前
GPT-2 from scratch with torch:用 torch 从零实现 GPT-2
人工智能·gpt·transformer·论文解读·gpt-2
oort1232 小时前
吃上了自家的细糠,还挺丝滑,用起来手感还行,OortCloud发布新版AI编程平台,下载 OortCodex,Token多,免费薅
大数据·开发语言·人工智能·ai编程
AI小码2 小时前
把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与
大数据·人工智能·算法·ai·大模型·音视频·编程
AI多Agent协作实战派2 小时前
AI多Agent协作系统实战(二十三):Agent读HEARTBEAT.md不读AGENTS.md——openclaw的文件加载之谜
前端·数据库·人工智能·uni-app
爱研究的小梁2 小时前
乾元通聚合路由及管理平台支持全面适配信创
网络·人工智能·信息与通信
水如烟3 小时前
孤能子视角:智能系统的持续学习——从关系场存续到模块化生长
人工智能
做一个码农都是奢望3 小时前
0722 LLM及其科研进展
人工智能
饼饼学习空间智能3 小时前
2026数字孪生国产化进入“交付验证期”:五类头部企业能力与项目选型分析
人工智能