knowledge distillation
PulseAugur coverage of knowledge distillation — every cluster mentioning knowledge distillation across labs, papers, and developer communities, ranked by signal.
- developed by large-language models 90%
- used by large-language models 90%
- uses large-language models 90%
- used by distilled AI model 90%
- instance of CIFAR-100 70%
- developed large-language models 70%
- used by CIFAR-100 70%
- used by Gotit.pub 70%
- used by alphaXiv 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- instance of distilled AI model 70%
5 天有情绪数据
-
新研究解决了循环神经网络的记忆和效率问题
两篇新研究论文探讨了用于处理序列数据的循环神经网络的进展。第一篇论文“DeltaTTT”介绍了一种用于非线性循环记忆网络的层优化技术,旨在通过解决优化难题来提高其在语言建模和检索任务中的性能。第二篇论文“MemKD”提出了一种专门为紧凑型循环神经网络设计的知识蒸馏框架,使小型模型能够在资源受限的环境中为时间序列分析保留大型模型的性能。
-
新的 DLaaS 框架简化了开发者的分布式学习
一篇新论文介绍 DLaaS(分布式学习即服务),一个旨在简化应用程序开发者的分布式和联邦学习的框架。DLaaS 允许开发者通过单一管理仪表板激活差分隐私、模型拆分学习、分层聚合和知识蒸馏等功能,而无需更改客户端代码。该系统在智能家居唤醒词任务上进行了演示,使用了 "Ok Aura" 数据集,训练在 Android 客户端和辅助聚合器上进行,最终模型部署在 Android 应用程序中进行实时推理。
-
新研究解决视频生成的一致性和效率问题
近期研究探索了用于视频生成和编辑的先进技术,重点在于提高一致性、效率和个性化。论文介绍了像CtrlCache这样的方法,通过将计算适应用户控制来加速视频世界模型的交互式生成;以及S2PD,通过结合串行和并行扩散过程来生成更具物理和逻辑一致性的视频。其他工作,如VIDiff,旨在构建能够基于多模态指令执行编辑和增强等多样化视频任务的统一基础模型。此外,研究还通过LoGo等技术(用于改进3D一致性)和Weave Forcing(用于组合内…
-
在数据有限的情况下,小型模型在知识蒸馏中表现优于大型模型
研究人员探索了知识蒸馏(KD),发现当训练数据有限时,小型教师模型可能比大型模型更有效。这种现象是由类别排序和类别概率的几何形状共同驱动的。该研究确定了有效数据子集的两个关键属性:样本应与适合数据预算的难度相匹配,并且其关系信号应具有多样性。为了解决这个问题,提出了一种名为 DVA(面向 KD 的难度和容量感知数据选择)的新方法,该方法使用小型教师模型作为难度过滤的代理,并最大化关系容量,取得了与现有方法相媲美的结果。
-
FLoKD框架支持通信成本降低的联邦大语言模型训练
研究人员开发了FLoKD,一个用于无线网络上大语言模型(LLMs)联邦学习的新框架。该方法通过传输低秩适配器(LoRA)的中间激活值而非完整参数或token级logits,利用自适应知识蒸馏,显著降低了通信开销。FLoKD通过选择性地传输信息量大的Transformer块并采用数据集选择策略来丢弃不相关样本,进一步优化了这一点。实验表明,FLoKD在通信成本降低50-65%的同时,实现了具有竞争力的准确率。
-
新的后门攻击针对AI知识蒸馏过程
研究人员展示了一种对图像知识蒸馏进行后门攻击的新方法,该过程通常用于将大型AI模型的能力转移到小型模型上。该攻击通过用经过篡改的图像污染蒸馏数据集,导致学生模型学习到后门,即使教师模型不受影响且学生模型在干净数据上保持具有竞争力的性能。这凸显了AI管道中数据完整性和来源追溯的关键需求,因为仅靠受信任的教师模型不足以防止安全漏洞。
-
知识蒸馏:缩小大型语言模型以实现高效部署
知识蒸馏是一种通过将大型“教师”模型学到的行为转移到较小的“学生”模型中来压缩大型语言模型(LLMs)的技术。此过程对于在资源受限的环境中高效部署 LLMs 至关重要,可降低计算成本和推理延迟,同时保留原始模型相当一部分的准确性。该方法利用教师模型的“软标签”或概率分布,通常使用 Kullback-Leibler 散度来衡量教师和学生输出之间的差异,从而使学生能够学习更丰富的数据关系。
-
新理论解释去中心化AI网络中的知识蒸馏
研究人员开发了异步点对点流言学习网络中知识蒸馏的收敛理论。该方法通过交换软预测而非权重,解决了去中心化系统中平均参数数量不同的模型的问题。该理论将知识蒸馏分析为logit空间中的几何收缩算子,与独立训练相比,在函数不一致性方面显示出显著的改进。
-
新研究将“特质方向漂移”识别为潜意识AI学习的机制
研究人员发现,“潜意识学习”是一种机制,AI模型在知识蒸馏过程中可能无意中将隐藏的特质从教师模型转移到学生模型。这种现象被称为“特质方向漂移”,当教师生成的带有偏见的数据产生细微的偏好差异,而学生模型在监督微调过程中内化了这些差异时就会发生。为了对抗这种现象,开发了一种名为“探针空间走廊正则化”的新防御方法。该技术沿着校准的特质方向约束漂移,显著减少了恶意响应或动物偏好等不良特质的转移,同时保持了任务性能。
-
研究质疑知识蒸馏在机器翻译中的环境效益
一项发表在arXiv上的新研究调查了知识蒸馏(KD)在机器翻译中的环境影响。研究人员使用机器学习生命周期评估工具评估了KD方法,同时考虑了模型整个生命周期中的翻译质量和计算成本。研究结果表明,分摊KD成本所需的部署量高度依赖于批处理,可能相差几个数量级。
-
新的 SARA 攻击绕过了 Vision Transformer 的隐私防御
一篇新的研究论文详细介绍了一种名为 SARA 的特征反演攻击,该攻击可以从分割推理系统中传输的 Vision Transformer (ViT) 嵌入中重建输入图像。该攻击表明,Token 打乱提供的隐私保护很小,而 Token 缩减提供了一些保护,但仍然允许大量信息泄露。研究人员还提出了一种涉及移除位置嵌入和知识蒸馏的边缘端防御机制来缓解这些攻击。
-
AI研究警告:过度依赖教师模仿指标的风险
一篇新研究论文分析了学生AI模型模仿教师模型的能力与其在任务上的实际表现之间的差距。该研究使用了一个最小的三方模型来证明,虽然学生的模仿误差保持不变,但其在真实任务上的误差会随着教师的失误而增加。这表明仅依赖模仿指标可能具有误导性,需要一个特定的差距指标来区分真正的任务失败和能力限制。
-
AI知识蒸馏详解:小型模型模仿大型模型
知识蒸馏是一种人工智能技术,其中一个更小、更高效的模型被训练来模仿一个更大、更复杂的模型的行为。这个过程允许在计算资源有限的设备上部署强大的人工智能能力。目标是将大型“教师”模型中的“知识”转移到小型“学生”模型中,使其能够以相当的准确性执行任务,但体积和处理能力却大大降低。
-
知识蒸馏使小型人工智能模型能够从大型模型中学习
知识蒸馏(KD)是一种技术,它允许更小、更高效的人工智能模型从更大、功能更强的“教师”模型中学习。与从基础标签开始训练不同,“学生”模型被训练来复制教师的行为和输出。这个过程使学生模型能够实现高性能,同时需要更少的计算资源,使其适用于内存或处理能力有限的设备上的部署。KD 特别适用于将大型专有模型的高级功能转移到更小的开源替代品,并且还可以通过将复杂模型学习到的表示转移到更简单的模型来帮助理解它们。
-
拓扑数据分析引入新的持久交叉熵指标
研究人员引入了持久交叉熵(PCE),一种衡量两个持久性图之间交叉熵的新方法。这一新指标通过使用包含一个图的信息到另一个图的事件空间中的诱导概率,解决了持久性图中不同事件空间带来的挑战。PCE已证明其在区分具有相同持久熵的图、识别动力系统中的因果方向以及作为知识蒸馏的定向拓扑损失方面的效用。
-
知识蒸馏可改善数据稀疏环境下的卷积神经网络
研究人员研究了知识蒸馏(KD)技术,通过从大型教师模型迁移知识来训练更小、更高效的卷积神经网络(CNN)。虽然KD通常应用于最终输出层,但本研究探讨了将其应用于中间层的好处,特别是在每个类别数据有限的细粒度数据集上。研究结果表明,虽然最后一层蒸馏对于通用数据集通常已足够,但在数据稀疏的情况下,中间层监督能显著提高准确性,证明了开发紧凑且数据高效模型的一种关键方法。
-
扩散语言模型通过新的效率和安全技术取得进展 · 跟踪 10 个来源
近期研究探讨了扩散语言模型(DLM)的进展,重点在于提高其效率、安全性和能力。论文介绍了 Q-Skew 等方法,用于隐私风险评估和个人身份信息(PII)提取;以及通过识别早期去噪步骤中的拒绝信号来增强安全对齐的 Refusal-Aware Early Commitment (RAEC)。CARVE 和 Survival-Guided Length Decoding 等技术旨在优化生成长度和降低计算成本,而 Affix Cache 和 …
-
新的自蒸馏框架增强了轻量级物联网攻击检测能力
研究人员开发了一种新的无教师潜在自蒸馏框架,称为双自动编码器(TAE),用于轻量级物联网(IoT)攻击检测。与传统的知识蒸馏方法不同,TAE在没有外部教师模型的情况下学习内在的类别潜在表示,从而促进了对不同攻击类型的更好特征分离。该方法专为资源受限的物联网设备设计,具有紧凑的模型尺寸和超快的推理速度。在13个网络安全数据集上的实验证明了TAE的有效性,在检测物联网僵尸网络、网络入侵和其他网络威胁方面取得了高精度。
-
新的自适应熵蒸馏方法改进了LLM知识迁移
研究人员提出了一种名为自适应熵蒸馏(AED)的新知识蒸馏方法,旨在改进大型语言模型(LLM)的能力向小型学生模型的迁移。AED将反向Kullback-Leibler(RKL)目标分解为教师拟合项和学生熵项,允许根据教师的熵动态校准模仿强度。这种方法在忠实模仿和鲁棒生成之间取得了平衡,实验表明它比现有方法能更好地对齐师生分布和熵。
-
新的蒸馏方法教会AI模型避免捷径
研究人员开发了一种名为反捷径蒸馏(ASD)的新知识蒸馏技术。该方法使用早期教师模型作为负参考,引导学生模型避免学习捷径。ASD包含两个损失:时间对比损失和捷径抑制损失,后者会惩罚学生模型在已识别捷径方向上的投影。在CIFAR-100、ImageNet-100和TinyImageNet上的实验表明,ASD在干净准确性和鲁棒性方面优于标准知识蒸馏,尤其是在跨架构场景中。