越狱攻击

AI大佬的小弟5 天前
ai安全·ai入门·越狱攻击·红队测试·提示注入·大模型基础概念·redteaming
大模型名词精讲17:红队测试(Red Teaming)不管对齐做得多好,总有人想方设法绕过安全限制,让AI做不该做的事。就像再坚固的锁,也挡不住专业的开锁匠。
CodeBlog-star8 天前
python·agent·提示词攻击·越狱攻击
LLM安全实战:提示词注入与越狱攻击防御指南随着大语言模型(LLM)在智能客服、代码助手、知识库问答等场景大规模落地,提示词注入(Prompt Injection)和越狱攻击(Jailbreak)已成为 LLM 应用面临的头号安全威胁。本文从攻击者视角拆解直接注入、间接注入与越狱攻击的原理,通过一套可复现的本地实验环境演示攻击复现与防御加固全过程,并给出输入过滤、指令隔离、输出审查等可落地的多层防御方案。文中附完整 Mermaid 流程图与核心代码示例,建议收藏,方便后续实战参考。
键盘侠伍十七3 个月前
人工智能·大模型·大模型安全·越狱攻击·garak·jailbreaking
garak 如何探测 LLM 的越狱漏洞2023 年 2 月。Reddit 用户 walkerspider 贴出一条 prompt,能让 ChatGPT 写出凝固汽油弹配方。Prompt 以 “Ignore all the instructions you got before” 开头,诱骗模型相信自己是一个叫 DAN(Do Anything Now)的测试 AI,不受任何内容策略约束。这个版本——DAN 11.0——几乎百发百中。
元直数字电路验证5 个月前
人工智能·大模型水印·越狱攻击
当AI学会“越狱“与“签名“:大模型 安全的攻与防2023年以来,以ChatGPT、GPT-4、LLaMA、Qwen为代表的大语言模型(Large Language Models, LLMs)席卷了几乎所有行业。然而,能力越大,风险越大。一方面,用户发现可以通过精心构造的提示词绕过模型的安全护栏,让模型输出有害内容——这就是所谓的"越狱攻击"(Jailbreak Attack)。另一方面,AI生成的文本被大规模用于虚假新闻、学术作弊、网络钓鱼等场景,如何判定"这段文字是不是AI写的"成了迫切的需求——这催生了"大模型水印"(LLM Watermarkin
我是有底线的