实体
Group Sequence Policy Optimization
Group Sequence Policy Optimization
PulseAugur coverage of Group Sequence Policy Optimization — every cluster mentioning Group Sequence Policy Optimization across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
SEAR系统在多语言语音挑战赛中准确率达90.92%
研究人员为多语言对话语音语言模型(MLC-SLM)挑战赛开发了一个名为SEAR的系统,准确率达到90.92%。该系统通过将ASR转录转换为事件跨度来调整Qwen3-Omni-30B-A3B-Instruct模型,然后利用这些跨度来合成语义和声学选择题。这些选择题使用Qwen3.6-27B生成语义选择题,使用Gemini 3.1 Flash-Lite生成声学选择题,并经过严格的验证步骤确保数据质量。
-
新的S-trace方法提高了RLVR的效率和信用分配
研究人员推出了一种名为选择性合格追踪(S-trace)的新方法,旨在增强大型语言模型在可验证奖励强化学习(RLVR)框架内的推理能力。这种新方法通过超越统一信用分配,解决了现有无批评者算法(如Group Relative Policy Optimization, GRPO)的局限性。S-trace选择性地屏蔽低熵标记,从而实现更高效的学习和细粒度的信用分配,并在Qwen3等模型上展示了卓越的性能和效率。