实体
GTPO
GTPO
PulseAugur coverage of GTPO — every cluster mentioning GTPO across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
PhysTacGen框架生成视觉-触觉传感器图像
研究人员开发了PhysTacGen,一个用于生成视觉到触觉传感器图像的新颖框架。该系统集成了材料感知描述和几何条件,以克服数据收集的挑战以及视觉外观与材料属性之间的差距。PhysTacGen利用一种称为Group Tactile Policy Optimization (GTPO)的强化学习策略来优化语言模型以生成结构化材料描述,并结合DINOv2进行配对筛选和用于几何先验的相对深度估计。然后,一个SDXL ControlNet合成光…
-
新的ACPO框架增强了大型语言模型的强化学习能力
研究人员推出了一种名为自适应信用策略优化(ACPO)的新框架,旨在改进大型语言模型强化学习中的信用分配。ACPO通过不对称地调整策略更新来解决稀疏奖励的挑战,重点关注成功试验中的不确定决策和失败试验中的过度自信的token。该方法旨在在保持策略梯度方向的同时,提高在AIME 2025和HumanEvalPro等基准测试上的性能,优于DAPO、GTPO和SAPO等现有方法。