ZeroOne AI
← 返回文章列表

PKD:偏好驱动的知识蒸馏,少样本节点分类(NeurIPS 2025)

👁 3
分类:工业AI

本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。PKD 通过融合 GNN 偏好节点选择器(GNS)、节点偏好 GNN 选择器(NGS)与图拓扑感知(GTA)提示微调,让 LLM 与多种 GNN 在少样本节点分类上互补协同,把蒸馏粒度细化到「节点-教师」配对级别,仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率。

项目背景

文本属性图(TAG)——如引文网络、网页图、商品共购图——上的节点分类,图神经网络(GNN)凭借消息传递机制高效运行,但训练严重依赖人工标注,而真实场景往往只有每类 1–5 个标签。

更深层的问题是:真实图节点的局部拓扑复杂多样,单一消息传递机制(GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播)无法同时覆盖所有节点。

已有工作各有短板:

同时,LLM 零/少样本能力强(如 Llama-3.1-8B、Qwen2.5-7B),但参数量大、推理难扩展,且与 GNN 的嵌入空间差异巨大(decoder-only vs encoder-only),直接蒸馏不可行。

PKD 的思路是:让 LLM 只标注最有价值的分歧节点,让每个节点只听最懂它的教师

技术方案

核心思想:双向偏好

PKD 框架的总设计原则是「双向偏好」:

前置条件是先用 GTA 提示微调 LLM,使其具备图拓扑理解能力——GTA 设计了 4 类结构化任务:连通性判断、节点度、环检测、随机游走文本生成。微调后 LLM 在多数图上超越部分半监督 GNN,为高质量标注奠定基础。

方法四要素

1. K-不确定性节点选择

定义为 B 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明:高不确定性节点对教师 GNN 增强更有益。按不确定性排序取前 W 个节点交给 LLM 标注,既保证信息量又降低 LLM 推理成本。

2. DNS 距离邻居选择

在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重,将邻居文本与节点语义拼成类别归纳提示,摆脱 1-hop 同质性偏差,K 默认取 4。

3. 三部分蒸馏损失

蒸馏损失由蒸馏项、交叉熵项与熵正则项组成,软标签由节点偏好掩码加权,实现定制化蒸馏。

4. NGS 强化学习

把教师选择建模为强化学习:State 是节点语义/结构/预测属性提示,Action 是离散教师采样,Reward 融合蒸馏损失差、交叉熵损失差与学生 GNN 分类精度。LLM 解码不可微,故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计,优化用简化版 PPO,学生 GNN 参数全程固定。

系统架构

LLM×GNN 协同蒸馏分类全景

PKD 由四大模块构成完整闭环:

教师池设计

实施过程

评测协议

核心实验结果

应用价值

关键发现

局限性

实践启示

PKD 为少样本图学习提供了重要的范式参考:当标注稀缺时,与其盲目增加标注,不如让 LLM 与 GNN 各司其职——LLM 负责标注最有价值的分歧节点,GNN 负责高效推理,通过节点-教师级别的精细化蒸馏实现标签效率的大幅提升。

SEO关键词

PKD, 知识蒸馏, 少样本节点分类, 图神经网络, LLM, GNS, NGS, GTA提示微调, NeurIPS 2025

评论(0