PulseAugur
实时 10:38:33
实体 Qwen-2.5-VL-7B

Qwen-2.5-VL-7B

PulseAugur coverage of Qwen-2.5-VL-7B — every cluster mentioning Qwen-2.5-VL-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_244867 ·

    新的强化学习框架增强多模态代理自我验证能力

    研究人员开发了一个名为“通过强化学习进行自我验证”(SVRL)的新型强化学习框架,以提高多模态推理代理的可靠性。该框架训练代理在其自身的推理过程中验证和过滤检索到的证据,从而减少对外部验证器的需求。SVRL还包含一个面向搜索的惩罚项,以最大限度地减少不必要的工具调用,并对生成多样化、格式良好的搜索查询给予奖励。当仅使用5000个视觉问答示例应用于Qwen-2.5-VL-7B模型时,SVRL在多跳VQA泛化和工具效率方面表现出持续的改进…