PKD:偏好驱动的知识蒸馏,少样本节点分类(NeurIPS 2025)
本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。PKD 通过融合 GNN 偏好节点选择器(GNS)、节点偏好 GNN 选择器(NGS)与图拓扑感知(GTA)提示微调,让 LLM 与多种 GNN 在少样本节点分类上互补协同,把蒸馏粒度细化到「节点-教师」配对级别,仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率。
项目背景
文本属性图(TAG)——如引文网络、网页图、商品共购图——上的节点分类,图神经网络(GNN)凭借消息传递机制高效运行,但训练严重依赖人工标注,而真实场景往往只有每类 1–5 个标签。
更深层的问题是:真实图节点的局部拓扑复杂多样,单一消息传递机制(GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播)无法同时覆盖所有节点。
已有工作各有短板:
- 传统 GNN(GCNII、EGNN):标签极度稀疏时能力受限,GCNII 在 Ogbn-Arxiv 上仅 35.14%;
- LLM 增强 GNN(LLMGNN、GAugLLM):伪标签质量低,节点选择不可靠;
- 自训练方法(Self-training、AGST、IceBerg):过度依赖原始拓扑,大图易 OOM,异质图上传播失败;
- 图知识蒸馏(KDGA、MSKD、BGNN 等):对教师选择过度敏感,不感知节点级局部拓扑。
同时,LLM 零/少样本能力强(如 Llama-3.1-8B、Qwen2.5-7B),但参数量大、推理难扩展,且与 GNN 的嵌入空间差异巨大(decoder-only vs encoder-only),直接蒸馏不可行。
PKD 的思路是:让 LLM 只标注最有价值的分歧节点,让每个节点只听最懂它的教师。
技术方案
核心思想:双向偏好
PKD 框架的总设计原则是「双向偏好」:
- GNS(GNN-preference-driven Node Selector):选出 GNN 偏好的节点,交给 LLM 标注;
- NGS(Node-preference-driven GNN Selector):为每个节点选出节点偏好的教师,做定制化蒸馏。
前置条件是先用 GTA 提示微调 LLM,使其具备图拓扑理解能力——GTA 设计了 4 类结构化任务:连通性判断、节点度、环检测、随机游走文本生成。微调后 LLM 在多数图上超越部分半监督 GNN,为高质量标注奠定基础。
方法四要素
1. K-不确定性节点选择
定义为 B 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明:高不确定性节点对教师 GNN 增强更有益。按不确定性排序取前 W 个节点交给 LLM 标注,既保证信息量又降低 LLM 推理成本。
2. DNS 距离邻居选择
在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重,将邻居文本与节点语义拼成类别归纳提示,摆脱 1-hop 同质性偏差,K 默认取 4。
3. 三部分蒸馏损失
蒸馏损失由蒸馏项、交叉熵项与熵正则项组成,软标签由节点偏好掩码加权,实现定制化蒸馏。
4. NGS 强化学习
把教师选择建模为强化学习:State 是节点语义/结构/预测属性提示,Action 是离散教师采样,Reward 融合蒸馏损失差、交叉熵损失差与学生 GNN 分类精度。LLM 解码不可微,故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计,优化用简化版 PPO,学生 GNN 参数全程固定。
系统架构
LLM×GNN 协同蒸馏分类全景
PKD 由四大模块构成完整闭环:
- GTA 微调:让 LLM 具备图拓扑理解能力;
- GNS 节点选择:选出分歧最大、最值得 LLM 标注的节点;
- DNS 邻居选择:在教师嵌入空间构造类别归纳提示;
- NGS 教师选择:为每个节点分配最合适的教师做蒸馏。
教师池设计
- 同质图:GCN / GAT / APPNP / H₂GCN(学生 GCN);
- 异质图:DirGNN / GPRGNN / HoloNets / H₂GCN(学生 H₂GCN)。
实施过程
评测协议
- 9 个真实 TAG 数据集(同质性 0.150–0.825);
- 每类随机 1/3/5 个标签作为初始训练集,由 GNS 扩展到 48% 训练比例;
- 其余 32% 验证 / 20% 测试,重复 5 次;
- 基线含 GCNII、EGNN、LLMGNN、GAugLLM、Self-training、AGST、IceBerg、KDGA、MSKD、BGNN、MTAAM、FairGKD 及 Random/Voting。
核心实验结果
- 仅用每类 5 个标注节点,Cora 准确率达 91.14%;
- 在 9 个真实文本属性图上全面超越用 48% 标签训练的最强基线;
- 三组件全开(GTA+DNS+节点选择):Cora +41.14pp、Amazon Ratings +23.97pp;
- 教师选择机制对比(Cora):RL 90.27 vs Entropy 75.70 / Random 62.80 / End-to-end 60.29;
- LLM 无关性:换 Qwen2.5-7B(Cora 90.07)与 Mixtral-8x7B(Cornell 81.58)依然领先;
- 选对节点比多标注更重要:K-不确定性选节点 Cornell 达 80.95%,随机选择仅 54.31%(差距 26.64pp)。
应用价值
关键发现
- 预测蒸馏优于特征对齐蒸馏:LLM 与 GNN 架构差异巨大,预测蒸馏只传递类别概率分布,规避维度与语义对齐问题,是标签稀缺场景的高效选择;
- 只标注分歧最大的节点:既保证信息量又控制 LLM 推理成本;
- RL 教师选择碾压启发式:为每节点学习分配策略是核心价值。
局限性
- 仅针对文本属性图,非文本图或缺属性场景不适用;
- 训练效率开销:Cora 上 7.314 s/epoch(含预训练),高于 FairGKD 的 4.100,LLM 推理是主要瓶颈;
- LLM 调用成本随扩展比例近似线性上升;
- 超参敏感性:标注监督权重与奖励平衡参数需按数据集调参。
实践启示
PKD 为少样本图学习提供了重要的范式参考:当标注稀缺时,与其盲目增加标注,不如让 LLM 与 GNN 各司其职——LLM 负责标注最有价值的分歧节点,GNN 负责高效推理,通过节点-教师级别的精细化蒸馏实现标签效率的大幅提升。
SEO关键词
PKD, 知识蒸馏, 少样本节点分类, 图神经网络, LLM, GNS, NGS, GTA提示微调, NeurIPS 2025
