PulseAugur
中
实时 10:23:58
实体 cross entropy

cross entropy

PulseAugur coverage of cross entropy — every cluster mentioning cross entropy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
28
90 天内 28
发布 · 30天
0
90 天内 0
论文 · 30天
28
90 天内 28
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 30 条
  1. TOOL · CL_284603 ·

    新研究探讨双曲表示学习中的隐式偏差

    本文深入探讨了多类别数据的双曲表示学习的隐式偏差,并通过布斯曼风险的视角进行了分析。研究利用布斯曼函数将双曲空间中到类别原型的距离分解为径向和方向分量。主要发现包括基于漂移系数的径向二分法,该系数决定了半径是扩张还是收缩,以及边界方向收敛到布斯曼风险的临界点。

  2. TOOL · CL_280389 ·

    新的训练方法提高了语言模型生成程序的效率

    研究人员开发了一种名为约束感知训练的新训练目标,用于语言模型,特别是用于程序生成。该方法旨在通过在解码过程中外部化某些程序分析,而不是通过标准的交叉熵进行教学,来提高效率。理论上,这种方法可以带来更小的模型和更有效的数据使用,合成实验表明,与传统训练相比,在匹配的参数数量和数据量下,预测损失更低。

  3. RESEARCH · CL_270786 ·

    新研究通过改进路由和扩散模型增强了 Mixture-of-Experts LLM · 跟踪到 2 个来源

    两篇新研究论文探讨了对 Mixture-of-Experts (MoE) 大型语言模型的增强。第一篇论文引入了 token-error supervision 来指导 MoE 路由,通过将路由亲和力与实际 token 错误对齐,提高了 Granite 和 ARC-Challenge 等基准的准确性。第二篇论文提出了用于非因子化扩散语言模型的 Enhanced Mixture-of-Experts (E-MoE),使用 MoE 路由在离…

  4. TOOL · CL_268252 ·

    新的熵正则化方法改进了可验证任务的AI模型训练

    研究人员发现,在标准交叉熵(CE)训练与在数学推理和代码生成等可验证领域生成正确输出的目标之间存在不匹配。这个问题之所以出现,是因为即使CE训练能够准确模仿专家演示,它也可能无意中为不正确的输出分配更高的概率。为了解决这个问题,提出了一种名为熵正则化交叉熵(ER-CE)的新方法,该方法使用令牌级别的香农熵作为代理来控制策略的支持并防止质量扩散到不支持的输出。在数学推理和代码生成基准上的实验表明,与标准CE相比,ER-CE始终能提高验证器的准确性。

  5. TOOL · CL_258958 ·

    研究人员揭示Adam优化器的稳定性相图

    研究人员为Adam优化器识别出了一个稳定性相图,揭示了其两个动量时间尺度如何控制训练不稳定性。他们发现在$(\beta_1,\beta_2)$平面上存在一个近似线性的边界,该边界将尖峰动态与非尖峰动态分开,这与损失函数的有效指数相关。该边界通过将Adam的动量时间尺度与二次损失之外的有限尺度超二次损失的几何形状联系起来,有助于解释损失尖峰。

  6. TOOL · CL_254844 ·

    新方法识别视觉问答模型关键图像区域

    研究人员开发了一种名为“反事实搜索地面区域”(CSGR)的新方法,用于识别对视觉问答(VQA)模型至关重要的图像区域。该方法通过干预图像区域来观察模型答案如何变化,从而 pinpoint 关键视觉证据。当应用于注意力引导和视觉CoT微调等现有训练技术时,CSGR标注在标准交叉熵微调上的性能持续提升,证明了其在面向地面训练中的实用性。

  7. TOOL · CL_247749 ·

    新损失函数解决序数分类中的“中心类别对冲”问题

    研究人员引入了一种名为自适应边界序数损失(AMOL)的新损失函数,以解决序数分类任务中的一种特定失败模式,即中心类别对冲。这种现象会导致神经网络通过最小化对称损失来偏向预测中间类别,而忽略真实标签。AMOL 应用一个乘性权重,当预测类别接近中心且真实标签远离中心时,该权重较大,从而惩罚这种对冲行为。实验表明,其不对称变体 AMOL-asym 在 Abalone 数据集上完全消除了中心类别对冲。

  8. TOOL · CL_228718 ·

    新的TPT方法提高了AI模型的校准和准确性

    研究人员发现,依赖于熵最小化的测试时提示调优(TPT)方法存在局限性,并指出这些方法可能导致过度自信的预测和模型校准下降。为解决此问题,提出了一种新目标,该目标使用交叉熵将原始视图预测与从增强视图派生的目标分布对齐。该方法还结合了目标分布的熵以捕捉样本特定的不确定性,并对增强视图预测采用置信度感知温度缩放。实验表明,该方法达到了最先进的准确性,并显著提高了模型校准。

  9. TOOL · CL_227220 ·

    新的审计框架质疑超声AI分类器的复杂性

    一篇新的研究论文介绍了一个受控审计框架,用于评估不确定性感知多器官超声分类器的架构复杂性。该研究将一个复杂的模型Full-EDL与更简单的替代模型进行了比较,发现在主要和复制数据集上,更简单的模型Simple-CE+TS表现相当。研究表明,组件应基于功能证据和对校准及分布偏移可靠性的单独评估来保留。

  10. TOOL · CL_223107 ·

    新理论解释 Transformer 语义学习,提出跳过 CoT 的方法

    一篇新的研究论文提出了一个框架,用于理解 Transformer 如何学习深度语义依赖,并识别出一种“梯度饥饿”现象,即在优化过程中,这些依赖的误差信号被抑制。这种抑制导致了结构化推理的相变,并解释了思维链(CoT)策略的有效性。研究人员在各种规模的 Transformer 上验证了他们的发现,包括 Llama-3.1-8B 和 Qwen2.5-Coder-7B 等生产模型,并开发了一种新的对比目标,与标准微调相比,在变量绑定任务上的…

  11. TOOL · CL_188741 ·

    损失函数详解:MSE、MAE、Huber 和交叉熵

    本文解释了损失函数在机器学习中的双重作用:量化误差和通过其导数指导模型训练。文章详细介绍了均方误差(MSE)如何收敛到均值,以及平均绝对误差(MAE)如何收敛到中位数,并强调了 MSE 对异常值的敏感性。Huber 损失被提出作为一种折衷方案,在接近零误差时表现为二次方行为,在较大误差时表现为线性行为,以平衡异常值的影响和训练稳定性。对于分类任务,文章讨论了交叉熵损失,展示了其导数如何简化为预测概率与目标之间的差值,这种形式被用于训练语言模型。

  12. TOOL · CL_167598 ·

    新的自适应梯度下降方法改进了机器学习优化

    研究人员开发了一种新的自适应梯度下降方法,通过关注下降方向而非整个梯度变化来改进机器学习模型的优化。这种方法在arXiv论文中有所详述,它使用单侧Hölder正则条件,在梯度沿更新路径的行为有利时允许可能更大的步长。在二元分类和非凸回归基准上的评估表明,与其他的标量梯度方法相比,该方法在最终目标差距、梯度范数和分类间隔方面取得了更优异的结果。

  13. TOOL · CL_158682 ·

    小型种群 ES 微调 LLM 在奖励调整下显示出潜力

    一篇新的研究论文探讨了进化策略(ES)在微调大型语言模型(LLM)方面的有效性,特别是在使用二元奖励时。研究发现,在二元奖励训练中,ES 对大型种群规模的感知需求可能源于奖励设计和归一化,而非内在限制。通过禁用 z-score 优势归一化,研究人员证明了具有小型种群规模(N=2)的 ES 可以在 GSM8K 和 TREC 等基准测试上显著提高性能,甚至优于那些崩溃或性能下降的归一化变体。这表明,通过仔细的奖励设计和归一化,可以用最少的…

  14. RESEARCH · CL_160877 ·

    新的损失函数改进了用于推荐的图神经网络

    研究人员开发了一种名为基数分解损失(CDL)的新方法,以提高图神经网络在推荐系统中的性能。传统方法通常使用单一损失函数,如贝叶斯个性化排序(BPR),这可能导致属性嵌入崩溃并对下游任务产生负面影响。CDL 将交叉熵(CE)与 BPR 相结合,以更好地优化具有不同基数的关系,从而提高属性嵌入的可区分性。CDL 的有效性在五个数据集上得到了证明,其性能受到语义对齐和拓扑泄露等图属性的影响。

  15. RESEARCH · CL_156616 ·

    新研究应对 3D 点云分割挑战

    两篇新研究论文探讨了 3D 点云分割和理解的先进技术。第一篇论文研究了标准交叉熵损失在处理 3D 点云分割中的类别不平衡方面的有效性,发现它与专用方法相比具有竞争力,并将性能归因于损失景观的拓扑结构。第二篇论文介绍了 Point Ladder Tuning (PLT),这是一个参数高效的框架,通过分层适应过程来保留和重建细粒度的局部几何形状,从而适应预训练的点云模型。

  16. TOOL · CL_156467 ·

    提出Dice Loss用于数据不平衡NLP任务

    一篇研究论文提出,在遭受严重数据不平衡的自然语言处理任务中,可以使用Dice loss替代标准的交叉熵。该方法基于Sorensen-Dice系数或Tversky指数,旨在平衡假阳性和假阴性的重要性,使其对不平衡数据集更具鲁棒性。该论文还介绍了一种动态加权训练样本的方法,以减少易负例的影响,并在词性标注和命名实体识别等各种NLP任务上显示出改进的性能。

  17. TOOL · CL_150697 ·

    新的CoCo损失函数增强了嵌入结构和收敛性

    研究人员开发了一种名为CoCo的新损失函数,旨在创建规范化且结构良好的数据表示。CoCo鼓励类在内部塌缩,同时与其他类进行对比,目标是获得具有大角度分离的嵌入。理论分析表明,CoCo在初始化、更具信息量的梯度和更快的收敛性等方面优于点回归和交叉熵等目标。在OpenML-CC18基准测试上的实验表明,CoCo在促进更紧密的类聚类和提高预测性能方面,与核SVM和随机森林等现有方法相比具有竞争力。

  18. RESEARCH · CL_143334 ·

    新的CoCo损失函数提升了嵌入质量和训练速度

    研究人员推出了一种新颖的损失函数CoCo,旨在创建规范化且结构良好的数据表示。该函数促进类内塌陷和类间对比,使神经网络能够实现具有显著类间角度分离的几何最优嵌入。在OpenML-CC18基准上的理论分析和实验表明,CoCo相比于点回归和交叉熵等现有方法具有优势,能够带来更具信息量的梯度、更快的收敛速度和更紧密的类簇。

  19. RESEARCH · CL_143343 ·

    研究确定了有效表征先验以实现人工智能模型泛化的关键因素

    一篇新研究论文探讨了使表征先验在机器学习中有效的因素,特别是在模型从记忆转向泛化的“grokking”的背景下。这项涉及 188 次新运行的研究发现,将先验的特征族与任务对齐至关重要,因为错误的特征族会阻碍泛化。无标签不变性先验使用交换对作为正例,展示了可靠的加速,并且当与权重范数钳位结合时,实现了显著的提速。研究还表明,这些先验在训练过程早期应用时最有效,短暂的应用窗口可以捕获大部分好处。

  20. TOOL · CL_129194 ·

    研究将AI涌现延迟与表征结构形成联系起来

    研究人员调查了涌现现象,即模型在完全记住训练数据后很长一段时间内仍然能够泛化。通过对单层Transformer的实验,他们因果性地证明了涌现发生所需的时间直接与任务特定表征结构的形成有关。注入与真实任务结构相关的先验显著加速了涌现,而错误或随机的结构则延迟甚至完全阻止了涌现,这表明模型的内部表征是理解这种延迟的关键。