logarithmic loss
PulseAugur coverage of logarithmic loss — every cluster mentioning logarithmic loss across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究比较了AI分布外检测的训练目标
一篇新的研究论文系统地比较了图像分类中分布外(OOD)检测的四种训练目标。该研究使用OpenOOD协议和ResNet-18模型评估了交叉熵损失(Cross-Entropy Loss)、原型损失(Prototype Loss)、三元组损失(Triplet Loss)和平均精度(AP)损失。结果表明,虽然交叉熵损失、原型损失和AP损失在分布内准确率方面表现相似,但交叉熵损失通常提供最一致的OOD检测性能。
-
UQ-Loc 方法通过不确定性感知增强激光雷达定位
研究人员开发了 UQ-Loc,一种不确定性感知的激光雷达场景坐标回归新方法。该方法通过预测每个体素的完整协方差矩阵来扩展现有的 LightLoc 架构,从而量化了偶然不确定性。UQ-Loc 在训练中使用了负对数似然损失和基于 kNN 的正则化器,在推理中使用了修改后的 SC2-PCR 求解器。该系统通过预期的校准误差进行评估,证明了其改进的定位精度和良好校准的不确定性预测。
-
研究发现 MSE 损失会阻碍神经网络中的叠加
研究人员已经证明,均方误差(MSE)损失在训练神经网络以在叠加中编码特征方面是无效的,这种技术是指表示的特征多于神经元的数量。这一发现得到了数学分析和实验证据的支持,表明 MSE 损失不会激励网络利用叠加。作者建议在玩具模型或其他应用中以实现叠加为目标时,使用对数损失等替代损失函数。
-
新方法通过概率不确定性量化增强交通预测
研究人员开发了一种新颖的方法,可以将现有的确定性交通预测模型转换为概率性模型。该方法仅需将最终输出层替换为高斯混合模型(GMM)层,即可使模型在进行不确定性量化的同时预测交通动态。修改后的模型可以使用负对数似然(NLL)损失进行训练,而无需更改现有的训练流程。在各种数据集上的实验表明,该技术在保持确定性性能的同时,与单峰或确定性基线相比,即使在数据不完美的情况下也能提供更准确和信息量更大的概率预测。
-
Karpathy 重访 1989 年神经网络,用现代 AI 技术降低错误率
Andrej Karpathy 重建了一个 1989 年的神经网络,通过应用现代深度学习技术,错误率降低了 60%。他展示了使用交叉熵损失(而非均方误差)、AdamW 优化器以及数据增强(特别是图像移位)等创新方法,显著提高了模型的性能。Karpathy 还表明,即使使用原始的 1989 年方法,仅将数据集大小从 7,291 张图像增加到 50,000 张,也能大幅降低错误率。
-
新的SFT目标在有能力的LLM上优于NLL
研究人员探索了大型语言模型监督微调(SFT)的替代目标,超越了标准的负对数似然(NLL)。他们的研究通过在各种模型和基准上进行大量实验,揭示了不同的目标根据模型的性能表现更好。对于能力更强的模型,降低低概率token权重的目标更有效,而对于能力较弱的模型,NLL表现最佳。
-
DeepSeek-V4、LoRA 及其他 LLM 技术在新博客中详述
Outcome School 上线了一系列六篇博客文章,详细介绍了当代大型语言模型的基本组成部分。这些文章涵盖了 RMSNorm、DeepSeek-V4、LoRA、RoPE、GQA 和交叉熵损失等技术概念。这些解释旨在解读支撑现代人工智能系统的核心构建模块。
-
新框架通过分离层优化深度学习训练
研究人员引入了一个名为层分离优化(Layer Separation Optimization)的新颖框架,以解决深度学习模型使用交叉熵损失进行训练时面临的挑战。该方法旨在缓解深度网络训练过程中出现的强非凸性问题。通过使用辅助变量将复杂的优化问题分解为更小、更易于管理子问题,该框架在理论上为原始交叉熵损失提供了上限,并在数值实验中展示了改进的优化行为。