double descent
PulseAugur coverage of double descent — every cluster mentioning double descent across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
arXiv新论文探讨机器学习理论、样本量和优化
三篇最新的arXiv论文深入探讨了机器学习的理论基础和实际应用。其中一篇论文提出了一个用于估计机器学习模型所需样本量的统计框架,解决了传统功效分析在复杂、非线性模型上面临的挑战。另一篇论文提供了一个数学规划模型及其在机器学习和人工智能中应用的统一分类法,整合了不同子领域零散的文献。第三篇论文概述了过参数化机器学习的理论,探讨了高度复杂的模型如何在拟合嘈杂的训练数据的情况下仍能获得良好的泛化能力,并对传统的偏差-方差权衡提出了质疑。
-
研究发现:机器学习中的良性过拟合未能预测股权回报
一篇新的arXiv论文探讨了“良性过拟合”在股权回报预测中的现象。研究表明,尽管高度过参数化的机器学习模型可以有效地插值训练数据,但与更简单的基准相比,它们在股权回报预测方面并未产生更高的预测能力。研究观察到无脊模型中存在双下降模式,并发现最优脊模型在高参数-观测比下仅比无脊模型有微不足道的改进。最终,这两种先进模型都未能跑赢基本的历史平均值,这表明即使在复杂的机器学习架构中,标准的股权预测器也缺乏真正的预测能力。
-
机器学习偏差-方差权衡和双重下降:伦理考量
本文探讨了机器学习中的偏差-方差权衡和双重下降概念,并强调了它们的伦理影响。偏差-方差权衡描述了平衡模型简洁性(偏差)与其泛化到新数据能力(方差)的挑战。双重下降是一个较新的现象,它表明即使在过拟合之后,如果进一步增加复杂性,模型性能也可以再次提高。作者认为,理解这些概念对于在人工智能开发中做出合乎道德的决策至关重要,因为过拟合会延续训练数据中存在的偏差,而欠拟合可能导致有害的过度简化和忽略细微差别。
-
新的“分裂候选缩放”参数揭示了梯度提升决策树中的双重下降现象
研究人员为梯度提升决策树(GBDTs)识别出了一种新的容量参数,称为分裂候选缩放(split-candidate scaling),该参数可能导致一种称为双重下降(double descent)的现象。与神经网络不同,GBDTs一直缺乏一个清晰的单轴容量参数。这种新方法涉及调整分裂候选的数量,从而细化特征量化网格并扩展用于提升更新的可用路径。使用XGBoost、LightGBM和Catboost进行的实验表明,增加分裂候选的数量会导致…
-
量子计算研究探索电路优化和PQC性能
两篇新研究论文探讨了量子计算的进展,重点关注电路优化和性能的不同方面。第一篇论文介绍了一种神经引导采样方法,用于减少量子电路在转译后的复杂性,与现有的Qiskit和BQSKit优化级别相比,效率更高。第二篇论文研究了深度参数化量子电路(PQC),发现它们可以表现出双下降行为,随着模型尺寸的增加,在未见过的数据上性能得到改善,为量子机器学习提供了谨慎乐观的前景。
-
新研究发现扩散模型规避良性过拟合 · 跟踪2个来源
一项新的研究论文挑战了深度学习(尤其是在扩散模型中)泛化能力的普遍理解。该研究表明,在典型条件下,良性过拟合(一种在传统深度学习中过拟合有助于泛化的现象)在扩散模型中并不发生。研究人员发现,除非样本量随数据维度呈指数增长,否则过拟合和良好的泛化能力是互斥的,从而导致经典的U形损失曲线,而不是双下降。该论文指出了回归和分数匹配之间的关键差异,表明过拟合对分数匹配有害,并强调了时间平滑和提前停止的隐式正则化是防止扩散模型过拟合的因素。
-
新框架解码深度学习现象:Grokking 和双重下降
研究人员开发了一个新框架来分析和解释深度神经网络中复杂的学习动态,特别是关注 Grokking 和双重下降等现象。该框架将学习分解为两个竞争过程:编码器内部的表示学习和最终分类器的读出校准。通过应用这种分解,该研究提供了对泛化的更细致的理解,区分了真实和虚假的改进,并为可解释性研究提供了诊断工具。