实体
Owen-Shapley Policy Optimization
Owen-Shapley Policy Optimization
PulseAugur coverage of Owen-Shapley Policy Optimization — every cluster mentioning Owen-Shapley Policy Optimization across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AI和开源演讲征集周日截止
一个专注于开源及其应用的会议的论文征集即将截止。主题包括开源项目办公室(OSPO)、治理、网络安全、主权AI、教育技术以及用于数字主权的去中心化技术。提交截止日期为周日晚。
-
新的Owen-Shapley RL算法改进了LLM在搜索中的信用分配
研究人员推出了一种新颖的强化学习框架Owen-Shapley Policy Optimization (OSPO),旨在解决用于个性化推荐任务的大型语言模型中的信用分配问题。标准方法难以识别哪些特定token有助于高质量输出,尤其是在从不明确的语言推断用户意图时。OSPO根据token的边际贡献重新分配序列级奖励,在不要求参数化价值模型的情况下进行片段级信用分配。