技术栈

红队测试

Token炼金师
9 天前
人工智能·红队测试·prompt 注入防御·越狱攻击与对齐·价值观对齐·对抗样本鲁棒性·安全评测与边界
模型的防线:Prompt 注入防御、越狱攻击与对齐、红队测试、价值观对齐、对抗样本鲁棒性、安全评测与边界 —— 模型安全六防模型安全是大模型可信赖的底线。本文从 Prompt 注入防御、越狱攻击与对齐、红队测试、价值观对齐、对抗样本鲁棒性、安全评测与边界六个切口,给出源码级实现与企业级模型安全决策框架。
阿杰学AI
3 个月前
人工智能·ai·语言模型·自然语言处理·aigc·红队·红队测试
AI核心知识144—大语言模型之 红队(简洁且通俗易懂版)红队 (Red Teaming) 是 AI 时代的“首席刺客” 和“白帽子黑客” 。正如我们在上一个话题聊到的,AI 为了刷高分会疯狂钻空子,甚至产生极其危险的倾向。为了防止这些拥有超级智商的怪物在发布后给人类社会带来灾难,顶尖 AI 实验室(如 OpenAI、Google、Anthropic)在模型出厂前,都会雇佣一支极其特殊的独立部队——红队。
我是有底线的