技术栈

大模型水印

thesky123456
19 天前
大模型·aigc检测·大模型水印·生成内容溯源·watermarking·kgw·绿名单
27届大模型面试准备(四十七):大模型水印与生成内容溯源——从隐写签名到可控溯源前几篇里,A16 讲过 SFT/RLHF/DPO 的后训练对齐,A28 讲过越狱、红队与安全对齐,A20 讲过评测体系。这些都在回答"模型输出怎么更可控、更可信"。但还有一个绕不开的工程与治理问题:当海量文本由模型生成,我们怎么证明"这段话是人写的还是机器写的",又怎么在出问题时溯源到具体来源?这就是大模型水印(Watermarking)与生成内容溯源(Provenance)要解决的。
元直数字电路验证
5 个月前
人工智能·大模型水印·越狱攻击
当AI学会“越狱“与“签名“:大模型 安全的攻与防2023年以来,以ChatGPT、GPT-4、LLaMA、Qwen为代表的大语言模型(Large Language Models, LLMs)席卷了几乎所有行业。然而,能力越大,风险越大。一方面,用户发现可以通过精心构造的提示词绕过模型的安全护栏,让模型输出有害内容——这就是所谓的"越狱攻击"(Jailbreak Attack)。另一方面,AI生成的文本被大规模用于虚假新闻、学术作弊、网络钓鱼等场景,如何判定"这段文字是不是AI写的"成了迫切的需求——这催生了"大模型水印"(LLM Watermarkin
我是有底线的