实体
Adaptive Sharpness-Aware Minimization
Adaptive Sharpness-Aware Minimization
PulseAugur coverage of Adaptive Sharpness-Aware Minimization — every cluster mentioning Adaptive Sharpness-Aware Minimization across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
手术技能模型:跨量规表征的可迁移性研究
一篇新的研究论文调查了基于视觉的手术技能评估模型所学习的表征在不同评分量规之间的可迁移性。研究发现,虽然在JIGSAWS数据集上训练的模型可以在LASANA数据集上取得良好性能,但反向迁移并不成功,这可能是由于标注不一致。对照实验表明,任务特定的头部(head)而非骨干网络(backbone)承担了大部分技能预测的负担,这表明需要进一步的工作来区分可迁移的技能特征和特定领域的视觉模式。
-
新的TALAS框架提高了语言模型蒸馏效率
研究人员推出了一种用于预训练语言模型知识蒸馏的新框架TALAS。TALAS将分层对齐与先进的优化技术同步,以提高效率和性能。该框架选择性地将最终句子嵌入蒸馏到学生模型的上层,并为下层使用自蒸馏,同时结合自适应感知最小化以增强泛化能力。