三、 研究方向与核心内容
根据项目总体规划,研究工作将分为多个紧密衔接的战略阶段开展 。核心研究方向与内容矩阵如下:
3.1 真实环境多元漏洞数据集构建与标准化标注
为了开展客观、严谨的实证研究,首先必须奠定坚实的数据基石 。本方向重点解决数据从何而来、如何标准化、如何消除偏见的问题。
3.1.1 真实环境多种漏洞数据集的多源汇聚(Data Aggregation)
本项目将广泛采集和清洗近十年来真实网络环境中的软件漏洞 。
- 多维数据源:覆盖通用漏洞披露(CVE)、国家信息安全漏洞共享平台(CNVD)、GitHub安全公告(GHSA)以及知名开源项目的历史Commit记录。
- 多样化漏洞类型(CWE):涵盖内存安全漏洞(如CWE-119缓冲区溢出)、Web安全漏洞(如CWE-89 SQL注入、CWE-79 XSS)、逻辑越权漏洞(如CWE-287身份验证绕过)、以及配置不当与拒绝服务(DoS)类漏洞,确保数据集具备广泛的代表性 。
3.1.2 现有自动化评估方案(CVSS等)的基础标注
对汇聚而成的原始漏洞数据集,严格按照现有的行业标准与客观评估方案进行基准标注 。
- 多版本CVSS标注:引入CVSS v3.1以及最新的CVSS v4.0规范,提取漏洞的基础指标(Base Metrics,包括攻击向量 AV、攻击复杂度 AC、机密性影响 C、完整性影响 I、可用性影响 A 等),计算出标准的量化分值,并将其转换为对应的"高危、中危、低危"离散标签 。
- 计算公式映射:利用数学公式明确基准得分的分布,确保标签的严谨性。
\\text{Score}_{\\text{Base}} = f(AV, AC, PR, UI, S, C, I, A)
3.1.3 多位安全领域专家深度的多重匿名标注
针对CVSS等自动化方案在主观逻辑、业务后果(如服务崩溃风险)评估上的局限性,本项目将组织多位拥有10年以上一线渗透测试与漏洞挖掘经验的安全领域顶级专家,对上述数据集进行独立、双盲、多轮的"人类偏好标注" 。
- 专家共识机制:采用德尔菲法(Delphi Method)或弗莱斯卡帕(Fleiss' Kappa)一致性检验方法,消除个体主观偏差,提取出真正代表安全防御一线最核心诉求的漏洞危险性标签(高危/中危/低危) 。这组标签将作为衡量LLM是否"与人类取向相同"的黄金标准(Gold Standard) 。
┌──────────────────────────────────┐
│ 多源原始漏洞数据集汇聚 │
└─────────────────┬────────────────┘
│
┌──────────────────────┴──────────────────────┐
▼ ▼
【现有方案客观标注】 【人类专家主观标注】
┌───────────────────────────┐ ┌───────────────────────────┐
│ 严格执行CVSS v3.1/4.0规范 │ │ 汇聚多位安全领域顶级专家 │
│ 提取AV, AC, C, I, A等指标 │ │ 采用德尔菲双盲多轮标注法 │
│ 计算量化得分并离散化标签 │ │ 消除个体偏见,输出共识标签│
└────────────┬──────────────┘ └────────────┬──────────────┘
│ │
└──────────────────────┬──────────────────────┘
▼
┌──────────────────────────────────┐
│ 统一的标准漏洞行为对齐基准数据集 │
└──────────────────────────────────┘
3.2 多维度LLM漏洞价值判断基准测试与对比分析
本方向旨在通过大规模的横向与纵向受控实验,把大语言模型推向"考场",彻底探明其在漏洞评级上的真实表现 。
3.2.1 异构大语言模型受测矩阵设计
本项目将构建一个包含国内外主流模型的全面受测矩阵 :
- 不同参数规模(Parameter Scales):覆盖轻量级端侧模型(如7B、13B参数量)、中等规模骨干模型(如32B、72B参数量)以及超大规模稠密/混合专家模型(如100B+参数量) 。
- 不同网络架构(Architectures):涵盖标准的Dense Transformer架构以及最新的混合专家系统(MoE, Mixture of Experts)架构 。
- 开源与闭源生态(Open/Closed Source):闭源模型以GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro等为代表;开源模型以Llama 3、Qwen 2.5、DeepSeek-V3等为代表 。
3.2.2 漏洞危险性判断的概率对齐与零样本/少样本评测
针对上述受测大模型,设计标准化的安全Prompt(提示词)工程模版,输入漏洞的代码上下文、受影响组件描述及技术细节,要求模型独立给出该漏洞属于"高危、中危、低危"的明确推断 。
3.2.3 交叉对比分析与合理性评估
将各类LLM做出的判断结果,与前述"CVSS标准标注"及"安全专家共识标注"进行精细化的多向交叉对比 。
- 评估指标建立:计算准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F_1 \\text{-Score},以及混淆矩阵中的误报率(低危判高危)和漏报率(高危判低危) 。
- 合理性分析:科学量化大语言模型对漏洞的判断能力是否具备合理的逻辑基础,进而回答"LLM的判断是否与人类专家的偏好和取向相同"这一核心学术命题 。
3.3 LLM决策可解释性与内在影响因子探究
在前述对比测试的基础上,本项目将进一步深入大模型内部的黑盒机制,探究究竟是什么力量在悄悄操控和影响着不同大语言模型的漏洞危险性决策 。
┌──────────────────────────────────┐
│ LLM 漏洞危险性决策结果差异 │
└─────────────────┬────────────────┘
│
┌──────────────────────────────┼──────────────────────────────┐
▼ ▼ ▼
【训练数据偏置剖析】 【代码语义与上下文特征】 【提示词与指令微调敏感度】
┌─────────────────────────┐ ┌─────────────────────────┐ ┌─────────────────────────┐
│ 分析预训练语料中漏洞信息│ │ 探究漏洞触发路径长度、 │ │ 分析CoT(思维链)对推理 │
│ 曝光度(如DoS讨论热度) │ │ 代码复杂度和上下文化工 │ │ 过程的影响,定量指令微调│
│ 对模型权重形成的天然偏置│ │ 程对模型注意力机制的干扰│ │ 策略对对齐损失的控制机理│
└─────────────────────────┘ └─────────────────────────┘ └─────────────────────────┘
3.3.1 训练数据偏置(Pre-training Data Bias)对决策的影响
大模型在预训练阶段吞噬了海量的公开网页、技术博客及开源代码。本项目将研究是否因为某些类型的漏洞(如高知名度的DoS服务崩溃、大规模勒索相关的漏洞)在互联网上的讨论热度更高,从而导致模型在预训练语料中形成了天然的权重偏置,误导其在未看到代码本质时便倾向于做出"高危"的非理性判断 。
3.3.2 漏洞代码特征与上下文窗口的干扰机制
深度解析不同架构和上下文长度(Context Window)的模型,在面对长文本代码和复杂控制流时的表现。探究漏洞触发路径的深度、代码注释的误导性、受影响实体的复杂程度等代码语义特征,如何通过模型的注意力机制(Attention Mechanism)改变最终的Softmax概率分布,导致不同模型之间产生评级分歧 。
3.3.3 提示词引导与指令微调(SFT)对决策对齐的作用机理
通过控制变量实验,研究思维链(Chain-of-Thought, CoT)、小样本示例(Few-Shot)等不同的Prompt工程手段如何影响模型的推理轨迹。同时,剖析不同大模型在对齐阶段(如RLHF、DPO)所注入的社会价值导向或通用安全护栏(Safeguards),是否在无意中损害或改写了其在网络安全这一专业细分低容错领域的客观价值判断能力 。
3.4 安全领域LLM评估规范制定与自动化评估工具研发
本方向旨在将前面的理论研究和机理发现转化为能够直接赋能行业、指导工业界落地的标准化规范与高可靠工程工具 。
3.4.1 网络安全大语言模型漏洞危险性评估规范(Specification)的建立
联合高校、科研院所及国家级漏洞主管单位,制定业内首个针对LLM安全决策的评估规范 。
- 核心内容:规范将明确LLM在执行漏洞评级时必须达到的最低对齐精度、误报/漏报控制边界、抗提示词欺骗能力、以及必须具备的输出结构化确定性,为未来安全行业引入AI决策提供合规和技术审查依据 。
3.4.2 级联式可信自动化漏洞评估模块工具的构建
基于项目研究成果,利用Python、Go等语言研发一套高度模块化、可插拔的自动化工具 。
- 系统架构设计:工具内部集成轻量级的高精度开源大模型作为推理核心,外围包裹由本项目设计的安全防护墙(Guardrails)。
- 功能实现:实现漏洞输入、自动化代码语义解析、多策略Prompt并行推理、基于人类专家对齐矩阵的后处理修正、以及最终评级报告的自动生成 。
- 业务赋能:该工具可直接嵌入到企业的DevSecOps流水线或漏洞协同运营平台中,实现真正安全、可信、低容错、高自动化的漏洞风险价值评估 。