double descent
PulseAugur coverage of double descent — every cluster mentioning double descent across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的“分裂候选缩放”参数揭示了梯度提升决策树中的双重下降现象
研究人员为梯度提升决策树(GBDTs)识别出了一种新的容量参数,称为分裂候选缩放(split-candidate scaling),该参数可能导致一种称为双重下降(double descent)的现象。与神经网络不同,GBDTs一直缺乏一个清晰的单轴容量参数。这种新方法涉及调整分裂候选的数量,从而细化特征量化网格并扩展用于提升更新的可用路径。使用XGBoost、LightGBM和Catboost进行的实验表明,增加分裂候选的数量会导致…
-
量子计算研究探索电路优化和PQC性能
两篇新研究论文探讨了量子计算的进展,重点关注电路优化和性能的不同方面。第一篇论文介绍了一种神经引导采样方法,用于减少量子电路在转译后的复杂性,与现有的Qiskit和BQSKit优化级别相比,效率更高。第二篇论文研究了深度参数化量子电路(PQC),发现它们可以表现出双下降行为,随着模型尺寸的增加,在未见过的数据上性能得到改善,为量子机器学习提供了谨慎乐观的前景。
-
新研究发现扩散模型规避良性过拟合 · 跟踪2个来源
一项新的研究论文挑战了深度学习(尤其是在扩散模型中)泛化能力的普遍理解。该研究表明,在典型条件下,良性过拟合(一种在传统深度学习中过拟合有助于泛化的现象)在扩散模型中并不发生。研究人员发现,除非样本量随数据维度呈指数增长,否则过拟合和良好的泛化能力是互斥的,从而导致经典的U形损失曲线,而不是双下降。该论文指出了回归和分数匹配之间的关键差异,表明过拟合对分数匹配有害,并强调了时间平滑和提前停止的隐式正则化是防止扩散模型过拟合的因素。
-
新框架解码深度学习现象:Grokking 和双重下降
研究人员开发了一个新框架来分析和解释深度神经网络中复杂的学习动态,特别是关注 Grokking 和双重下降等现象。该框架将学习分解为两个竞争过程:编码器内部的表示学习和最终分类器的读出校准。通过应用这种分解,该研究提供了对泛化的更细致的理解,区分了真实和虚假的改进,并为可解释性研究提供了诊断工具。