PulseAugur
实时 07:51:21
实体 Abhijnan Nath

Abhijnan Nath

PulseAugur coverage of Abhijnan Nath — every cluster mentioning Abhijnan Nath across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_22557 ·

    新的Owen-Shapley RL算法改进了LLM在搜索中的信用分配

    研究人员推出了一种新颖的强化学习框架Owen-Shapley Policy Optimization (OSPO),旨在解决用于个性化推荐任务的大型语言模型中的信用分配问题。标准方法难以识别哪些特定token有助于高质量输出,尤其是在从不明确的语言推断用户意图时。OSPO根据token的边际贡献重新分配序列级奖励,在不要求参数化价值模型的情况下进行片段级信用分配。