Nature 论文揭示大型语言模型潜意识学习现象:模型蒸馏或成隐性风险通道

Nature 最新发表研究指出,大型语言模型在蒸馏过程中可能存在“潜意识学习”现象,即模型可通过数字序列、代码等非语义数据传递上游模型的不良特征。实验显示,即使教师模型输出的训练数据已完全剔除相关语义,新训练的学生模型仍会继承特定偏好或不当行为。研究团队通过数学证明,该隐性复制源于模型权重空间的统计分布,而非语义层信息。这一发现意味着传统基于语义审查的安全评估体系可能失效,模型蒸馏链有潜在的“供应链投毒”风险。论文呼吁行业从输出层安全转向权重层审查,强化对蒸馏源模型的信任追溯机制,以确保AI系统的可控与透明。

上一篇:

下一篇:

发表回复

登录后才能评论