研究人员探索了两层随机特征网络中的弱到强泛化,其中在较弱教师模型数据上训练的学生模型取得了更好的性能。利用随机矩阵理论,该研究推导了教师模型和学生模型误差的确定性等价物。对于ReLU激活和特定的目标函数,分析揭示了二次改进,学生误差的缩放比例为教师误差的平方,达到了一个通用的下界。 AI
影响 为模型泛化能力提供了理论见解,可能为未来的网络架构提供信息。
排序理由 阐述机器学习理论发现的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
研究人员探索了两层随机特征网络中的弱到强泛化,其中在较弱教师模型数据上训练的学生模型取得了更好的性能。利用随机矩阵理论,该研究推导了教师模型和学生模型误差的确定性等价物。对于ReLU激活和特定的目标函数,分析揭示了二次改进,学生误差的缩放比例为教师误差的平方,达到了一个通用的下界。 AI
影响 为模型泛化能力提供了理论见解,可能为未来的网络架构提供信息。
排序理由 阐述机器学习理论发现的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
完整方法见我们的编辑标准。
arXiv:2610.09044v1 Announce Type: cross Abstract: Weak-to-strong generalization is the phenomenon where a strong student model trained with labels produced by a weak teacher model is able to generalize better than the teacher. In this paper, we study this phenomenon in two-layer …