PulseAugur
实时 09:07:32
实体 cross entropy

cross entropy

PulseAugur coverage of cross entropy — every cluster mentioning cross entropy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 20
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_188741 ·

    损失函数详解:MSE、MAE、Huber 和交叉熵

    本文解释了损失函数在机器学习中的双重作用:量化误差和通过其导数指导模型训练。文章详细介绍了均方误差(MSE)如何收敛到均值,以及平均绝对误差(MAE)如何收敛到中位数,并强调了 MSE 对异常值的敏感性。Huber 损失被提出作为一种折衷方案,在接近零误差时表现为二次方行为,在较大误差时表现为线性行为,以平衡异常值的影响和训练稳定性。对于分类任务,文章讨论了交叉熵损失,展示了其导数如何简化为预测概率与目标之间的差值,这种形式被用于训练语言模型。

  2. TOOL · CL_167598 ·

    新的自适应梯度下降方法改进了机器学习优化

    研究人员开发了一种新的自适应梯度下降方法,通过关注下降方向而非整个梯度变化来改进机器学习模型的优化。这种方法在arXiv论文中有所详述,它使用单侧Hölder正则条件,在梯度沿更新路径的行为有利时允许可能更大的步长。在二元分类和非凸回归基准上的评估表明,与其他的标量梯度方法相比,该方法在最终目标差距、梯度范数和分类间隔方面取得了更优异的结果。

  3. TOOL · CL_158682 ·

    小型种群 ES 微调 LLM 在奖励调整下显示出潜力

    一篇新的研究论文探讨了进化策略(ES)在微调大型语言模型(LLM)方面的有效性,特别是在使用二元奖励时。研究发现,在二元奖励训练中,ES 对大型种群规模的感知需求可能源于奖励设计和归一化,而非内在限制。通过禁用 z-score 优势归一化,研究人员证明了具有小型种群规模(N=2)的 ES 可以在 GSM8K 和 TREC 等基准测试上显著提高性能,甚至优于那些崩溃或性能下降的归一化变体。这表明,通过仔细的奖励设计和归一化,可以用最少的…

  4. RESEARCH · CL_160877 ·

    新的损失函数改进了用于推荐的图神经网络

    研究人员开发了一种名为基数分解损失(CDL)的新方法,以提高图神经网络在推荐系统中的性能。传统方法通常使用单一损失函数,如贝叶斯个性化排序(BPR),这可能导致属性嵌入崩溃并对下游任务产生负面影响。CDL 将交叉熵(CE)与 BPR 相结合,以更好地优化具有不同基数的关系,从而提高属性嵌入的可区分性。CDL 的有效性在五个数据集上得到了证明,其性能受到语义对齐和拓扑泄露等图属性的影响。

  5. RESEARCH · CL_156616 ·

    新研究应对 3D 点云分割挑战

    两篇新研究论文探讨了 3D 点云分割和理解的先进技术。第一篇论文研究了标准交叉熵损失在处理 3D 点云分割中的类别不平衡方面的有效性,发现它与专用方法相比具有竞争力,并将性能归因于损失景观的拓扑结构。第二篇论文介绍了 Point Ladder Tuning (PLT),这是一个参数高效的框架,通过分层适应过程来保留和重建细粒度的局部几何形状,从而适应预训练的点云模型。

  6. TOOL · CL_156467 ·

    提出Dice Loss用于数据不平衡NLP任务

    一篇研究论文提出,在遭受严重数据不平衡的自然语言处理任务中,可以使用Dice loss替代标准的交叉熵。该方法基于Sorensen-Dice系数或Tversky指数,旨在平衡假阳性和假阴性的重要性,使其对不平衡数据集更具鲁棒性。该论文还介绍了一种动态加权训练样本的方法,以减少易负例的影响,并在词性标注和命名实体识别等各种NLP任务上显示出改进的性能。

  7. TOOL · CL_150697 ·

    新的CoCo损失函数增强了嵌入结构和收敛性

    研究人员开发了一种名为CoCo的新损失函数,旨在创建规范化且结构良好的数据表示。CoCo鼓励类在内部塌缩,同时与其他类进行对比,目标是获得具有大角度分离的嵌入。理论分析表明,CoCo在初始化、更具信息量的梯度和更快的收敛性等方面优于点回归和交叉熵等目标。在OpenML-CC18基准测试上的实验表明,CoCo在促进更紧密的类聚类和提高预测性能方面,与核SVM和随机森林等现有方法相比具有竞争力。

  8. RESEARCH · CL_143334 ·

    新的CoCo损失函数提升了嵌入质量和训练速度

    研究人员推出了一种新颖的损失函数CoCo,旨在创建规范化且结构良好的数据表示。该函数促进类内塌陷和类间对比,使神经网络能够实现具有显著类间角度分离的几何最优嵌入。在OpenML-CC18基准上的理论分析和实验表明,CoCo相比于点回归和交叉熵等现有方法具有优势,能够带来更具信息量的梯度、更快的收敛速度和更紧密的类簇。

  9. RESEARCH · CL_143343 ·

    研究确定了有效表征先验以实现人工智能模型泛化的关键因素

    一篇新研究论文探讨了使表征先验在机器学习中有效的因素,特别是在模型从记忆转向泛化的“grokking”的背景下。这项涉及 188 次新运行的研究发现,将先验的特征族与任务对齐至关重要,因为错误的特征族会阻碍泛化。无标签不变性先验使用交换对作为正例,展示了可靠的加速,并且当与权重范数钳位结合时,实现了显著的提速。研究还表明,这些先验在训练过程早期应用时最有效,短暂的应用窗口可以捕获大部分好处。

  10. TOOL · CL_129194 ·

    研究将AI涌现延迟与表征结构形成联系起来

    研究人员调查了涌现现象,即模型在完全记住训练数据后很长一段时间内仍然能够泛化。通过对单层Transformer的实验,他们因果性地证明了涌现发生所需的时间直接与任务特定表征结构的形成有关。注入与真实任务结构相关的先验显著加速了涌现,而错误或随机的结构则延迟甚至完全阻止了涌现,这表明模型的内部表征是理解这种延迟的关键。

  11. RESEARCH · CL_128502 ·

    新的LP-SFT方法在微调过程中保留语言模型能力

    研究人员推出了一种新颖的监督微调方法LP-SFT,旨在保留预训练语言模型固有的熵结构。标准的微调会因过度关注目标标签词元而损害现有能力。LP-SFT通过维持替代合理词元之间的相对结构来解决这个问题,从而在不牺牲采样多样性的情况下缓解能力退化。实验表明,LP-SFT在平衡准确性和更广泛的性能指标方面优于普通SFT和其他增强基线。

  12. RESEARCH · CL_115242 ·

    新的SMMD训练方法增强了LLM的数值精度

    研究人员开发了一种名为平滑最大均值差异(SMMD)的新训练目标,以提高大型语言模型(LLM)的数值精度。标准的交叉熵训练将数值标记视为类别,忽略了它们固有的值结构。SMMD通过引入值距离核和基于图的平滑性来解决这个问题,将预测分布与目标值对齐,并鼓励局部一致性。在数学推理和图表问答等任务上,对各种LLM和视觉语言模型骨干的评估表明,SMMD的性能始终优于现有方法。

  13. RESEARCH · CL_109605 ·

    新的序数交叉熵框架增强了用于医疗预测的深度学习能力

    研究人员引入了一个名为序数交叉熵(OCE)的新框架,旨在提高深度神经网络在目标标签具有内在序数结构的医疗应用中的准确性。传统的交叉熵等损失函数没有考虑到错误分类的不同严重程度,而这可能对临床产生重大影响。OCE框架通过引入一个序数成本矩阵来反映这些不同的错误分类成本,从而扩展了标准的交叉熵,实现了更平滑的优化和更好的序数一致性。实验表明,在预测误差成本和校准方面,OCE的表现优于现有的最先进的序数方法。

  14. TOOL · CL_106808 ·

    交叉熵训练下 Transformer 层的均场控制分析

    研究人员使用连续深度均场控制的视角,在交叉熵训练框架内分析了 Transformer 层。他们将深度视为时间,将层参数视为控制,将 Transformer 递归建模为受控隐藏状态流的显式欧拉方案。该研究为极限种群问题推导了庞特里亚金条件,其中终端伴随项包含 softmax 残差,并为有限类和度量熵场景提供了估计。

  15. RESEARCH · CL_100090 ·

    新研究深入探讨 Transformer 的能耗、学到的线性以及训练动态

    近期研究探索了 Transformer 模型的复杂性,重点关注其能耗、内部线性特性和训练动态。其中一篇论文引入了一个缩放模型,用于预测微调期间的能耗,该模型受 Roofline 模型启发,并考虑了并行效应。另一项研究调查了 Transformer 前馈块的线性,揭示了这种特性是学到的而非架构性的,并且在不同层之间存在显著差异。第三篇论文通过连续深度均场控制的视角分析了 Transformer 层,将交叉熵训练与最优控制问题联系起来。此…

  16. TOOL · CL_98023 ·

    权重范数在神经网络 Grokking 中的作用得到阐明

    研究人员调查了神经网络中“Grokking”现象,即模型从记忆转向泛化。他们的发现表明,先前被认为是这种转变主要驱动因素的权重范数,主要充当 Logit 尺度的上游控制。通过直接操纵 Logit 尺度,研究人员可以控制 Grokking 延迟的整个范围,而权重范数仅产生微小的附加效应。发现这种关系取决于所使用的损失函数,均方误差显示出与交叉熵不同的机制。

  17. TOOL · CL_45002 ·

    新的损失函数可加速监督学习中的神经坍塌

    研究人员引入了新的方法NTCE和NONL,通过更有效地实现神经坍塌(NC)来改进监督分类。这些技术解决了现有范式(如交叉熵和监督对比学习)的局限性。通过将监督学习视为超球体上的原型学习,新的损失函数能够更快地收敛到NC,并在迁移学习和鲁棒性方面取得显著改进,尤其是在类别不平衡的情况下。

  18. RESEARCH · CL_18343 ·

    研究人员开发用于无分布预训练的进化动态损失

    研究人员开发了一个名为进化动态损失(EDL)的新框架,用于预训练分类损失。EDL使用合成数据学习可迁移的损失函数,避免了在主要预训练阶段需要真实样本。该框架通过进化策略将损失优化为一个轻量级网络,并结合混沌变异来增强探索和改善收敛性。在CIFAR-10上的实验表明,EDL可以有效地替代交叉熵并达到相当或更好的准确率。

  19. RESEARCH · CL_11405 ·

    Linear-Core Surrogates 提供用于分类的平滑损失函数和线性速率

    研究人员推出了一种新型凸损失函数家族——Linear-Core (LC) Surrogates,旨在结合机器学习中平滑损失和分段线性损失的优点。这些代理是可微的,并实现了线性一致性界限,提供了更高的统计效率。在结构化预测任务中,LC Surrogates 能够实现更高效的随机梯度估计器,避免了二次复杂度,从而节省了大量的计算和能源。

  20. RESEARCH · CL_01041 ·

    对比学习提升AI模型鲁棒性和透明度

    对比学习是一种机器学习技术,它创建一个嵌入空间,将相似的数据点聚集在一起,并将不相似的数据点分开。该方法可应用于监督和无监督场景,在传统交叉熵损失函数方面具有优势,尤其是在安全关键型应用中。研究表明,监督对比学习通过改进特征归因解释,可以带来更值得信赖和更透明的神经网络。