Scaling Laws for Autoregressive Generative Modeling
PulseAugur coverage of Scaling Laws for Autoregressive Generative Modeling — every cluster mentioning Scaling Laws for Autoregressive Generative Modeling across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究表明超参数调优是小规模AI实验的关键
一篇新研究论文认为,由于超参数的敏感性,预测模型性能与模型大小之间关系的缩放定律在小规模下并不可靠。作者们证明,对于小规模实验而言,调优良好的超参数比模型大小更关键。他们还发现,随着模型规模的增大,超参数的敏感性会降低,从而更容易找到。该研究提出了一种新的以模型为中心的研究方法,并成功将其应用于确定Transformer架构中归一化层的最佳位置,从小规模实验中恢复了大规模结果。
-
AI规模定律在训练前预测粒子物理模型性能
研究人员开发了一种方法,利用规模定律在粒子物理领域的大型机器学习模型训练完成之前预测其性能。通过在较小的模型上拟合联合模型和数据规模定律,他们能够以高精度预测使用更多计算资源训练的显著更大的模型的损失。这种预测能力可以将计算预算转化为预期的物理性能,有助于为诸如射流标记和背景拒绝等任务有效分配资源。
-
AI扩展定律因制度偏见面临审查
作者质疑普遍存在的行业信念,即扩展定律是AI进步的唯一决定因素,并提出制度偏见和辩证探究也是关键因素。这一观点挑战了仅仅增加模型规模和数据就必然带来更好AI的观念,提倡对AI发展进行更细致的理解。
-
UltraX框架通过自适应程序化编辑优化LLM预训练数据
研究人员推出UltraX,一个旨在优化大型语言模型(LLM)大规模预训练数据的新型框架。该系统通过专注于通过自适应程序化编辑来提高数据质量,解决了仅增加数据量带来的收益递减问题。UltraX通过实现细粒度的实例级编辑(包括插入、删除和修改)来提高数据利用率,并采用可靠的程序监督生成流程。实验表明,UltraX提高了数据效率和优化可靠性,与现有方法相比,在训练的token更少的情况下实现了高性能。
-
新专著勾勒深度学习理论从近似到涌现的蓝图
一本题为《从近似到涌现:深度学习理论》的新专著,提供了一个统一的、面向证明的现代深度学习理论叙述。本书追溯了该领域从近似和泛化等经典概念到过参数化、生成模型、Transformer和涌现等当代主题的演变。它旨在为研究人员和从业者提供一个严谨的深度学习理论图谱,强调其当前的强大之处、不完整性以及日益增长的对学习机制如何从规模、数据、架构和训练中产生的关注。