实体
Geo3K
Geo3K
PulseAugur coverage of Geo3K — every cluster mentioning Geo3K across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新框架通过探索式提示脚手架改进多模态LLM训练
研究人员开发了一个探索式提示脚手架框架,以增强多模态大型语言模型中的强化学习。该方法通过使用探索潜力得分(EPS)来识别和重写信息量较少的提示,从而动态调整训练提示的分布。通过将教师监督重新定义为数据精炼而非模仿,该方法在Geo3K、MMK12、MathVision和MMMU-Pro等各种基准测试中显示出显著的性能提升。
-
新的 BPPO 方法提高了 LLM 的效率和简洁性
研究人员开发了二元前缀策略优化 (BPPO) 方法,该方法旨在提高使用组相对策略优化 (GRPO) 训练的大型语言模型 (LLM) 的效率和简洁性。BPPO 仅优化响应的前缀,降低了计算成本,并在不牺牲准确性的情况下鼓励更短、更直接的答案。该方法在 GSM8K 和 MATH 等推理任务的实验中显示出显著的速度提升和响应长度缩减。