Hao Liang
PulseAugur coverage of Hao Liang — every cluster mentioning Hao Liang across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究解释GRPO归一化在自适应梯度中的作用
一篇新研究论文探讨了组相对策略优化(GRPO)中归一化的必要性和有效性。GRPO是语言模型强化学习的标准算法。该研究发表在arXiv上,理论上证明了GRPO的归一化充当自适应梯度,提高了比标准REINFORCE方法更快的收敛速度。研究人员还引入了重要性采样变体IS-GRPO,并在GSM8K和MATH数据集上进行了实证验证,尤其是在每提示方差异构的情况下,显示出性能提升。
-
新基准评估LLM在合成数学数据中查找错误的能力
研究人员推出了MathDebugger,这是一个旨在评估大型语言模型检测和诊断合成数学数据中错误能力的新基准。该基准包含正确和错误的问题数据集,以及带注释的解决方案,在人类注释者之间达成高度一致。对14个大型语言模型和三个过程奖励模型的评估显示,即使是先进的模型在完全饱和MathDebugger方面也面临挑战,尤其是在细粒度错误识别方面。研究还强调了模型解决和验证能力之间的差距,表明明确的错误信息可以指导数据合成和质量控制流程的改进。
-
已撤稿论文分析无线联邦学习中的差分隐私
这篇题为“当差分隐私遇上无线联邦学习:隐私与收敛性的改进分析”的论文已被作者Hao Liang撤回。该研究旨在解决现有差分隐私无线联邦学习(DPWFL)框架的局限性,特别是在严格假设下的隐私损失特征化和收敛性分析方面。作者提出了对具有非凸损失目标的DPWFL进行全面分析,包括设备选择和mini-batch采样,并旨在证明隐私损失可以收敛到一个常数。该工作还旨在建立具有梯度裁剪的收敛保证,并推导出明确的隐私-效用权衡,数值结果验证了理论发现。