PulseAugur
实时 07:26:33
实体 knowledge distillation

knowledge distillation

PulseAugur coverage of knowledge distillation — every cluster mentioning knowledge distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 59
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 55
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/3 页 · 共 59 条
  1. TOOL · CL_212047 ·

    新的自蒸馏框架增强了轻量级物联网攻击检测能力

    研究人员开发了一种新的无教师潜在自蒸馏框架,称为双自动编码器(TAE),用于轻量级物联网(IoT)攻击检测。与传统的知识蒸馏方法不同,TAE在没有外部教师模型的情况下学习内在的类别潜在表示,从而促进了对不同攻击类型的更好特征分离。该方法专为资源受限的物联网设备设计,具有紧凑的模型尺寸和超快的推理速度。在13个网络安全数据集上的实验证明了TAE的有效性,在检测物联网僵尸网络、网络入侵和其他网络威胁方面取得了高精度。

  2. TOOL · CL_205815 ·

    新的自适应熵蒸馏方法改进了LLM知识迁移

    研究人员提出了一种名为自适应熵蒸馏(AED)的新知识蒸馏方法,旨在改进大型语言模型(LLM)的能力向小型学生模型的迁移。AED将反向Kullback-Leibler(RKL)目标分解为教师拟合项和学生熵项,允许根据教师的熵动态校准模仿强度。这种方法在忠实模仿和鲁棒生成之间取得了平衡,实验表明它比现有方法能更好地对齐师生分布和熵。

  3. TOOL · CL_198291 ·

    新的蒸馏方法教会AI模型避免捷径

    研究人员开发了一种名为反捷径蒸馏(ASD)的新知识蒸馏技术。该方法使用早期教师模型作为负参考,引导学生模型避免学习捷径。ASD包含两个损失:时间对比损失和捷径抑制损失,后者会惩罚学生模型在已识别捷径方向上的投影。在CIFAR-100、ImageNet-100和TinyImageNet上的实验表明,ASD在干净准确性和鲁棒性方面优于标准知识蒸馏,尤其是在跨架构场景中。

  4. RESEARCH · CL_200277 ·

    新的蒸馏方法改进了自回归视频生成

    研究人员开发了上下文匹配蒸馏(CMD),这是一个用于改进自回归视频生成模型的新颖框架。CMD将教师模型的监督与学生模型在生成过程中可用的因果上下文对齐,解决了现有方法使用双向教师的局限性。该框架结合了前缀评分和前缀损坏等技术来稳定训练并增强控制依从性,在短视频和长视频基准测试中均展示了最先进的性能。

  5. RESEARCH · CL_198158 ·

    研究基准测试小型语言模型的可靠性:量化优于剪枝

    一篇新的研究论文探讨了小型语言模型(SLMs)的可靠性,通过比较预训练模型和压缩模型。研究发现,在保持可靠性方面,量化比网络剪枝更有效,包括公平性、鲁棒性、隐私和道德等方面。通过量化压缩可靠的大型语言模型(LLMs)可以得到比从头开始训练的SLMs更具可靠性和适应性的SLMs。此外,从可靠的教师模型进行知识蒸馏可以进一步提高SLMs的可靠性。

  6. TOOL · CL_196125 ·

    新的SQuaT框架增强了低比特模型的自监督知识蒸馏

    研究人员开发了SQuaT,一种新颖的自监督知识蒸馏框架,解决了现有方法在将感知量化训练与蒸馏相结合时的局限性。SQuaT通过将学生模型的量化参数应用于教师的特征,理论上消除了蒸馏损失的不可约下界。这种方法在极端低比特量化场景下表现出显著的性能提升,并且广泛适用于各种模型架构。

  7. SIGNIFICANT · CL_193046 ·

    字节跳动创始人张一鸣回归,叫停AI模型蒸馏

    字节跳动创始人张一鸣已重返公司,并指示其种子AI研究团队停止模型蒸馏。他认为这种通过在大型模型上训练小型模型来快速提升基准分数的方法,会阻碍长期创新。此举标志着字节跳动将战略重心转向开发更基础的AI能力。

  8. TOOL · CL_191364 ·

    新框架利用联邦学习增强物联网入侵检测

    研究人员开发了一个名为 FedTransKD-IDS 的新框架,以改进物联网 (IoT) 和 5G 网络中的入侵检测系统。该框架通过采用联邦学习、联邦迁移学习和知识蒸馏来解决隐私和可扩展性挑战。该系统表现出强大的性能,在检测异构数据集中的入侵时达到了 99.18% 的准确率和 99.99% 的召回率。

  9. TOOL · CL_191479 ·

    TM20K 框架通过高效长序列建模提升电商广告推荐效果

    研究人员开发了 TM20K,一个新颖的两阶段知识蒸馏框架,用于增强电商广告推荐系统中的序列建模。该方法利用带有 token 合并技术的全 transformer 模型,高效处理长达 20,000 个 token 的超长序列。该框架成功将 ADSS 等关键业务指标提升了 1% 以上,同时保持了与现有最先进模型相当的训练和服务成本。

  10. TOOL · CL_180598 ·

    新的渐进式知识蒸馏方法用于模型压缩

    研究人员推出了一种名为 Progressive$^2$ 的新颖知识蒸馏方法,旨在实现大幅模型压缩。该方法采用一个渐进式增强的教师模型和一个渐进式减小的学生模型。教师模型利用基于课程的学习策略,逐步选择用于蒸馏的层,并引入多特征融合适配器以提高训练稳定性,该方法在理论上得到 Lipschitz 连续性的支持。学生模型的尺寸逐渐减小,以促进与教师模型的协同演化,从而提高整体性能,并在准确性和训练效率之间取得最佳平衡。

  11. RESEARCH · CL_171911 ·

    新的CoCaRS方法增强了异构知识蒸馏

    研究人员推出了一种新颖的异构知识蒸馏方法CoCaRS,旨在改善不同模型架构之间的知识迁移。CoCaRS通过混淆证据估计和强度分配控制来校准特征去相关性,从而更好地保留结构信息,解决了现有冗余抑制技术的局限性。此外,采用自适应系数调节来动态调整抑制目标,降低了对不同师生对和训练阶段的系数设置的敏感性。在CIFAR-100和ImageNet-1K数据集上的实验证明了CoCaRS在提高蒸馏性能和稳定性方面的有效性。

  12. TOOL · CL_167619 ·

    新的SPRKD方法增强了深度神经网络的知识蒸馏

    研究人员开发了一种名为SPRKD的新知识蒸馏技术,该技术将该过程从简单的输出复制重新构建为使用教师模型作为优化曲率和领域知识的代理。SPRKD识别教师模型损失景观中的低损耗鞍点区域,并利用这些区域来指导学生模型的学习。该方法在准确性方面显示出显著的改进,在疟疾血涂片分类等任务上,其性能大幅优于现有方法,并在MNIST和CIFAR-100等标准基准测试中取得了相当或更好的结果。该技术还使得学生模型具有更平滑的下降特性和更强的噪声鲁棒性。

  13. TOOL · CL_160712 ·

    新的SGRE框架旨在对抗LLM知识蒸馏

    研究人员引入了一个名为骨架引导推理编辑(SGRE)的新框架,旨在防止大型语言模型(LLM)的未经授权的知识蒸馏。这种“先回答后编辑”的方法首先从教师模型生成干净的推理轨迹,然后修改这些轨迹以增加学生模型的认知负荷。实验表明,SGRE在保持推理轨迹的准确性和自然性的同时,有效地阻止了蒸馏。

  14. COMMENTARY · CL_155161 ·

    人工智能模型“蒸馏”的说法受到开发者质疑

    多个Reddit讨论认为,关于中国AI模型通过“蒸馏”西方模型实现同等水平的说法被夸大了,并且常常歪曲了技术过程。参与者认为,使用公开API输出来进行训练更准确地描述为合成数据生成,而不是真正的蒸馏(后者需要访问模型logits)。讨论还涉及训练数据来源的法律和伦理影响、闭源API模型潜在的供应商锁定问题,以及这些指控的选择性应用,特别是针对中国实验室。

  15. TOOL · CL_151975 ·

    新的抗蒸馏采样保护分类模型免受知识蒸馏攻击

    研究人员开发了ADS-C,一种新颖的抗蒸馏采样技术,旨在保护分类模型免受知识蒸馏攻击。与以前的方法不同,ADS-C以输入和置信度边际预算为依赖的方式扰乱模型的输出分布。这种方法可证明地保留了防御模型的top-1预测准确性,同时显著降低了在包括CIFAR-100、CIFAR-10和Tiny-ImageNet在内的各种数据集上蒸馏学生模型的性能。

  16. TOOL · CL_147243 ·

    知识蒸馏:压缩大语言模型以实现高效部署

    知识蒸馏是一种通过将知识从大型“教师”模型转移到小型“学生”模型来压缩大语言模型(LLMs)的技术。此过程可降低计算需求和模型大小,使得LLMs能够部署在计算资源受限的设备(如手机)上。关键概念包括教师-学生框架、蒸馏损失和温度缩放,这些有助于学生模型在不显著降低准确性的情况下模仿教师模型的性能。该方法对于优化LLMs在自然语言处理和语音识别等各种应用中的部署至关重要。

  17. TOOL · CL_141454 ·

    新型LSTrans模型为可穿戴设备提供高效心电图分类

    研究人员开发了LSTrans,这是一种新颖的轻量级混合模型,用于计算能力有限的设备上的自动化心电图(ECG)分类。该模型结合了1D卷积骨干网络和Transformer编码器,并利用低秩自适应(Low-Rank Adaptation)来减少其参数数量。采用了知识蒸馏技术将大型模型的诊断能力迁移到LSTrans,该模型在实验中表现出具有竞争力的诊断灵敏度和显著提高的资源效率。

  18. TOOL · CL_141389 ·

    新的SMETA-ZSL方法推进了零样本网络安全威胁分类

    研究人员开发了SMETA-ZSL,一种用于网络安全零样本威胁分类的新方法。该方法通过对比微调语义原型和利用知识蒸馏进行行为特征对齐的片段式元学习来解决语义重叠和类别不平衡等挑战。SMETA-ZSL在七个基准测试中表现出色,在严格的归纳设置下,平均性能比以前的方法高出10.8个百分点。

  19. RESEARCH · CL_141265 ·

    新的SAKD框架通过学生引导的视图增强知识蒸馏

    研究人员引入了Shift-Augmented Knowledge Distillation (SAKD),一个新颖的框架,旨在通过利用学生模型的特征来指导生成多样化的视图,从而增强知识蒸馏。该方法旨在克服传统单教师蒸馏的局限性以及多教师方法相关的计算成本。SAKD能够实现单阶段训练,并通过无参数的循环移位产生自适应视图,在CIFAR-100和ImageNet数据集上展示了优于现有随机扰动和两阶段增强技术的性能和效率。

  20. RESEARCH · CL_141213 ·

    LaGuadia框架使用语言蒸馏病理学AI模型

    研究人员开发了LaGuadia,一个新颖的框架,通过自适应地从多个大型病理学基础模型中蒸馏知识来创建高效的病理学图像编码器。该方法使用从病理学报告中提取的临床关键词来指导蒸馏过程,确保每个教师模型的贡献根据其与临床叙事的语义相关性进行加权。实验表明,一个显著更小的LaGuadia模型可以在各种任务上匹配或超越大型基础模型的性能,突显了语言引导的语义锚定在构建可靠的数字病理学系统方面的有效性。