【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角

摘要

本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD ,通过融合GNN 偏好节点选择器 GNS节点偏好 GNN 选择器 NGS图拓扑感知(GTA)提示微调 ,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率,在 9 个真实文本属性图上全面超越用 48% 标签训练的最强基线,为少样本图学习提供了重要的范式参考。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Preference-driven Knowledge Distillation for Few-shot Node Classification
标题(中文) 偏好驱动的知识蒸馏:少样本节点分类
作者 Xing Wei, Chunchun Chen, Rui Fan, Xiaofeng Cao, Sourav Medya, Wei Ye
机构 同济大学电子与信息工程学院 / 同济大学计算机系 / 伊利诺伊大学芝加哥分校
会议 NeurIPS 2025
arXiv https://arxiv.org/abs/2510.10116
项目网站 https://github.com/GEEX-Weixing/PKD

背景与动机

文本属性图(TAG)------如引文网络、网页图、商品共购图------上的节点分类,图神经网络(GNN)凭借消息传递机制高效运行,但训练严重依赖人工标注 ,而真实场景往往只有每类 1--5 个标签。更深层的问题是:真实图节点的局部拓扑复杂多样,单一消息传递机制(GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播)无法同时覆盖所有节点。

已有工作各有短板:

  • 传统 GNN(GCNII、EGNN):在标签极度稀疏时能力受限,GCNII 在 Ogbn-Arxiv 上仅 35.14%。
  • LLM 增强 GNN(LLMGNN、GAugLLM):LLMGNN 缺乏精细微调与认知能力,伪标签质量低;GAugLLM 依赖 SoftMax 分数自训练,选节点不可靠,仅在 Pubmed 上最优(85.98%)。
  • 自训练方法(Self-training、AGST、IceBerg):AGST 过度依赖原始拓扑做标签传播,在大图 Ogbn-Arxiv 上直接 OOM;IceBerg 在异质图上因噪声边传播失败,Wisconsin 仅 41.53%。
  • 图知识蒸馏(KDGA、MSKD、BGNN、MTAAM、FairGKD) :KDGA 与 BGNN 对教师选择过度敏感,MSKD 固定消息传递机制,在所有数据集上均不如 PKD;MTAAM 与 FairGKD 表现较好但仍受限于「顺序/同时蒸馏」范式------不感知节点级局部拓扑

同时,LLM 零/少样本能力强(如 Llama-3.1-8B、Qwen2.5-7B),但参数量大、推理难扩展,且与 GNN 的嵌入空间差异巨大(decoder-only vs encoder-only),直接蒸馏不可行。PKD 的思路是:让 LLM 只标注最有价值的分歧节点,让每个节点只听最懂它的教师

研究主线:从问题到结论

图 6:PKD 研究主线流程图------问题→动机→预测蒸馏→双向偏好设计→9 数据集评测→结论(Mermaid 流程图)。

基准/方法设计

PKD 框架的总设计原则是「双向偏好」 :GNS(GNN-preference-driven Node Selector)选出GNN 偏好的节点 交给 LLM 标注,NGS(Node-preference-driven GNN Selector)为每个节点选出节点偏好的教师做定制化蒸馏。前置条件是先用 GTA 提示微调 LLM,使其具备图拓扑理解能力------GTA 设计了 4 类结构化任务:连通性判断、节点度、环检测、随机游走文本生成。

图 1:GTA 提示微调后 LLM 的零样本节点分类性能提升------微调让 LLM 在多数图上超越部分半监督 GNN,为高质量标注奠定基础。

分类全景

图 7:LLM×GNN 协同蒸馏分类全景------GTA 微调、GNS 节点选择、DNS 邻居选择与 NGS 教师选择四大模块(Mermaid 分类图)。

方法细节

核心设计四要素(框架图见图 2):

  1. K-不确定性 \\delta_K:定义为 B 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明:高 \\delta_K 节点对教师 GNN 增强更有益(证明见附录)。按 \\delta_K 排序得到偏好排名 \\mathcal{V}_{PR},只取前 W 个节点交给 LLM 标注,同时降低 LLM 推理成本。
  2. DNS 距离邻居选择:在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重,将邻居文本与节点语义拼成类别归纳提示------摆脱 1-hop 同质性偏差,K 默认取 4。
  3. 三部分蒸馏损失\\mathcal{L}*{KD}=\\alpha\\mathcal{L}*{DL}+\\beta\\mathcal{L}_{CE}+\\gamma H(f_S),其中软标签由节点偏好掩码 \\mathbf{m}_i 加权(\\widetilde{\\mathbf{z}}_i\^T=\\mathbf{m}_i\\otimes\\mathbf{z}_i\^T)。
  4. NGS 强化学习 :把教师选择建模为 RL------State 是节点语义/结构/预测属性提示,Action 是离散教师采样,Reward 为 R=\\eta(\\mathcal{L}*{DL}'-\\mathcal{L}*{CE})+(1-\\eta)A_{cc}A_{cc} 为学生 GNN 分类精度)。LLM 解码不可微,故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计;优化用简化版 PPO(无显式 Reward/Reference 模型,CLIP 限幅),学生 GNN 参数全程固定。

图 2:PKD 框架总览------两大模块 + DNS 提示构造,构成完整的双向偏好闭环。

实验设计与结果

评测协议:9 个真实 TAG 数据集(同质性 0.150--0.825),每类随机 1/3/5 个标签作为初始训练集,由 GNS 扩展到 48% 训练比例,其余 32% 验证 / 20% 测试,重复 5 次。同质图教师池为 GCN/GAT/APPNP/H₂GCN(学生 GCN),异质图教师池为 DirGNN/GPRGNN/HoloNets/H₂GCN(学生 H₂GCN)。基线含 GCNII、EGNN、LLMGNN、GAugLLM、Self-training、AGST、IceBerg、KDGA、MSKD、BGNN、MTAAM、FairGKD 及 Random/Voting。

主表(PKD 每类 5 标签 vs 用 48% 标签训练的基线,准确率 %):

方法 Texas Amazon Ratings Ogbn-Arxiv Cora
最佳教师 T(48% 标签) 82.83 48.93 59.19 88.38
GAugLLM(48% 标签) 73.81 42.42 53.47 79.48
AGST(48% 标签) 68.45 43.11 OOM 77.25
MTAAM(48% 标签) 80.81 39.54 32.32 79.16
Voting(48% 标签) 61.31 58.64 58.53 74.32
PKD #LN 1 80.36 64.11 53.67 85.64
PKD #LN 5 86.31 66.79 61.03 91.14

图 3:K-不确定性节点分布(Cora)------从箭头处逆时针 KL 散度和递增、颜色加深,PKD 优先选择高不确定性节点。

消融与机制验证

  • GTA+DNS+\\mathcal{V}_{PR} 三组件全开:Cora +41.14pp、Amazon Ratings +23.97pp,三组件互补(各去掉一个均有显著回落)。
  • 教师选择机制对比(Cora):RL 90.27 vs Entropy 75.70 / Random 62.80 / End-to-end 60.29------为每节点学分配策略是核心价值。
  • 奖励函数消融:精度 R_1 → +CE R_2 → +DL R_3,三部分缺一不可(图 5)。

图 4:邻居数 K 的敏感性------K=4 在多数图上取得峰值,是默认参数依据。

图 5:奖励函数消融------分类精度、交叉熵与蒸馏损失三部分共同作用时训练表现最优。

扩展性与运行时间:标注扩展比例 10%→48% 时 Cora 从 73.37 涨到 91.14(+17.77pp);代价是每轮训练约 7.3 秒(Cora),约为纯 GNN 方法(FairGKD 4.1s)的 1.8 倍。附录 A 数据集统计(同质性/节点/边/类)、附录 B 三种 LLM(Llama/Qwen2.5/Mixtral)一致性验证、附录 E 超参敏感性(\\alpha=0.5,\\beta=1,\\gamma=0.1,\\eta=0.3 最优,\\beta\\eta 最敏感)等细节见视频附录。

结果对比总结

图 8:PKD 结果对比总结------5 标签/类下 Cora 91.14%、Texas 86.31%、Amazon 66.79%,全面超越 48% 标签基线(Mermaid 对比图)。

关键发现

  1. 标签效率提升近 10 倍:PKD 每类 5 标签在 Cora 达 91.14%,优于 GCNII 用 48% 真实标签的 81.54%,LLM 标注质量逼近真实标签。
  2. 9 数据集一致领先:无论同质(Cora 91.14%)还是异质(Texas 86.31%)图,PKD 全部超越用 48% 标签训练的最强基线,最好成绩 6/9 数据集。
  3. LLM 无关性:换 Qwen2.5-7B(Cora 90.07)与 Mixtral-8x7B(Cornell 81.58、Wisconsin 77.36)依然领先,框架收益不依赖特定 LLM。
  4. 选对节点比多标注更重要:K-不确定性选节点 Cornell 达 80.95%,随机选择仅 54.31%(#LN5),差距 26.64pp。
  5. 消融三件套互补:GTA、DNS、\\mathcal{V}_{PR} 全开在 Cora 提升 41.14pp、Amazon Ratings 提升 23.97pp,每个组件独立贡献。
  6. RL 教师选择碾压启发式:RL 90.27 比熵排序 75.70 高 14.57pp(Cora),比端到端学习 60.29 高 29.98pp。

局限性

  • 仅针对文本属性图:依赖节点文本属性,非文本图或缺属性场景不适用。
  • 训练效率开销:Cora 上 7.314 s/epoch(含预训练),高于 FairGKD 的 4.100,LLM 推理是主要瓶颈,大图上更明显。
  • LLM 调用成本:GNS 标注与 NGS 逐节点推理均需调用 LLM,扩展比例增大时开销近似线性上升。
  • 超参敏感性\\beta(标注监督权重)与 \\eta(奖励平衡)对性能影响较大,需按数据集调参。

常见问题(FAQ)

PKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」?

LLM 是 decoder-only 架构、GNN 是 encoder-only 架构,两者嵌入空间特性与维度差异巨大,直接对齐需要复杂映射且训练成本高;预测蒸馏只传递类别概率分布,天然规避了维度与语义对齐问题,是标签稀缺场景下的高效选择。

GNS 如何决定哪些节点值得 LLM 标注?

GNS 计算多教师预测的两两对称 KL 散度之和(K-不确定性 \\delta_K),按 \\delta_K 排序取前 W 个节点;命题证明高 \\delta_K 节点对教师 GNN 增强更有益。只标注分歧最大的节点,既保证信息量又控制 LLM 推理成本。

NGS 的强化学习奖励是什么?

奖励绑定学生 GNN 在扩展训练集上的表现:R=\\eta(\\mathcal{L}*{DL}'-\\mathcal{L}*{CE})+(1-\\eta)A_{cc},融合蒸馏损失差、交叉熵损失差与分类精度三部分;消融显示三部分缺一不可,\\eta=0.3 最优。

PKD 换了 LLM 还能用吗?

能。论文用 Llama-3.1-8B、Qwen2.5-7B、Mixtral-8x7B 三种 LLM 验证,均全面超越 48% 标签训练的最佳基线;GTA 微调与框架设计本身与具体 LLM 解耦,代码开源可复现。

PKD 的训练成本高吗?

Cora 上每轮约 7.3 秒,是纯 GNN 基线(FairGKD 4.1s)的 1.8 倍,主要来自 LLM 推理;但只标注 Top-W 节点而非全图,成本远低于「全图 LLM 标注 + 蒸馏」的朴素方案,且换取约 10 倍的标签效率。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
猫先生Mr.Mao1 天前
具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”
机器人·大语言模型·论文解读·具身智能·saycan
DogDaoDao2 天前
GR00T N1 论文深度拆解:英伟达给机器人装上了“快与慢“双系统大脑
机器人·大语言模型·nvidia·机器人模型·智能机器人·图像生成模型·gr00t
白拾3 天前
【CVPR 2025】3D VLM 稠密知识 × 少样本精准校准:广义少样本三维点云分割框架 GFS-VL|从三维场景理解视角
语义分割·少样本学习·cvpr 2025·三维点云·视觉-语言模型·gfs-vl 论文分享
白拾4 天前
【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角
大语言模型·模型压缩·高效推理·efficient llm·mlsys·tmlr 2024
白拾5 天前
【CVPR 2025】UNEM:展开广义EM,让少样本推理超参数自动学习|从少样本学习算法设计视角
少样本学习·cvpr 2025·unem 论文分享·转导推理·算法展开
白拾5 天前
【CVPR 2025】2SFS:重新思考视觉语言模型的少样本适配,两阶段方案|从少样本泛化视角
少样本学习·视觉语言模型·参数高效微调·cvpr 2025·2sfs 论文分享
墨心@5 天前
阶段 4:事件总线
人工智能·语言模型·大语言模型·agent·codex·harness
白拾7 天前
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角
大语言模型·高效推理·mla·deepseek-v2 论文分享·moe 稀疏架构·arxiv 2024
夏文强8 天前
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁
人工智能·大语言模型·多模态·前沿技术·ai agent