data normalization
PulseAugur coverage of data normalization — every cluster mentioning data normalization across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
归一化与正则化:阐明关键的机器学习概念
归一化和正则化是机器学习中不同的概念,由于诸如“L2范数”之类的相似术语而常常被混淆。归一化是一个数据预处理步骤,它将输入特征缩放到可比较的范围,确保没有单个特征因其量级而占主导地位。这发生在模型训练之前。另一方面,正则化是一种在模型训练过程中用于惩罚模型复杂性并防止过拟合的技术。
-
LLM 引用不可靠;锚点提供更好的出处
一种从大型语言模型中提取信息的新方法建议使用“锚点”而不是直接引用来确保出处和准确性。该方法包括识别所需信息附近的简短、特定短语,然后使用确定性代码在源文本中定位确切的句子。据报道,与直接引用信息的模型相比,该方法实现了 93-100% 的锚点覆盖率和 100% 的出处保真度,显著降低了伪造数据的风险。
-
新研究质疑谱基础模型如何学习预处理不变性
一篇新发表在arXiv上的论文,以拉曼基础模型为例,质疑了谱基础模型中预处理不变性的测量方法。研究表明,当前方法可能错误地将不变性归因于学习到的参数,而实际上它只是归一化过程本身的结果。研究发现,在六个拉曼评估数据集上,该模型并未显著优于其自身的归一化,这表明声称的不变性可能并非学习而来。在另外两个系统上复制了类似的发现,这表明在各种模态的谱基础模型中,预处理不变性的评估方式存在更广泛的问题。
-
新研究详解多模态预训练的物理学和效率方法
研究人员探索了多模态预训练的基本机制和设计空间,重点关注不同模态在统一训练过程中如何相互作用。他们的实验揭示了知识流动的见解,其中语言、视觉理解和视觉生成以不同的模式跨模态地转移知识。该研究还确定了促进模态之间协同作用的架构选择,例如共享注意力机制和具有模态特定前馈层的归一化,并证明了早期统一模态比后期对齐更有效。这些发现促成了高效的预训练方法,在显著降低计算成本的情况下实现了强大的生成性能,并通过在万亿级标记上训练大型 MoE 模型得到了验证。
-
CNNs rely on pixel intensity over texture for vascular imaging
一篇新研究论文探讨了卷积神经网络(CNN)如何解释视觉信息以进行血管分割,应用于显微镜和眼底成像。研究发现,像素强度比纹理对这些网络更重要,即使纹理和强度线索退化,它们也能保持显著的准确性。CNN还表现出仅凭形状从有限的能力推断完整血管几何形状,依赖于大约20像素的感受野,而全局上下文对眼底图像只有微小的优势。
-
新的“权重范数临界性”解释了AI训练不稳定性
研究人员发现了一个新的深度神经网络训练不稳定的关键因素,称为“权重范数临界性”。这种现象不同于普遍理解的“学习率临界性”,它源于归一化技术和权重衰减之间的相互作用。随着权重衰减的增加,它可能将参数范数推向零,导致更陡峭的损失景观和突然的损失尖峰,从而破坏优化动态。这一发现为解释为什么过度的权重衰减虽然可能提高泛化能力,但最终会阻碍训练提供了机制性解释。