最近想系统地学一遍 LLM 大模型安全。
结果打开各种资料一看:满屏都是「数据投毒」「数据泄露」「内容安全」这些攻击场景和技术名词。单个看,每个都眼熟;可真要我整体讲一讲------LLM 安全到底怎么做?涉及哪些方面?------当场卡壳,一脸懵。
是不是有点像我?
后来我想明白了:问题出在缺一张「全景地图」。
我们看到了一个又一个风险点,却不知道它们分别发生在 LLM 生命周期的哪个环节;更不知道每个环节里,到底有什么「值得保护的东西」。
所以,我给自己定了一条学习路径:
先把 LLM 的全生命周期走一遍,搞清楚每个阶段「做了什么」;再回到安全视角,看每个阶段「有什么需要保护的产物」。
为什么这样学?
因为安全的核心问题,永远是「保护」。而想保护一样东西,第一步永远是搞懂它是什么、怎么运转。你看,LLM 的每个阶段都在「生产」某种产物------训练数据、模型文件、输出内容......每一个产物,都对应着不同的风险点。先把这张图画出来,后面的学习就有了坐标,不再迷路。
写这个系列,其实还有一层私心:学习这件事,输出是最好的输入。把过程整理成笔记,一是逼自己真正吃透,二是希望更多和我一样的同行------做安全的、做 AI 的、半路转行的------能一起少踩点坑。于是就有了这一系列的文章。