PulseAugur
实时 10:46:40
实体 S-GRPO

S-GRPO

PulseAugur coverage of S-GRPO — every cluster mentioning S-GRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_165336 ·

    4B开放权重模型在瑞典语医学问答方面接近GPT-4性能

    研究人员发现,较小的开放权重语言模型,特别是4B参数模型,在瑞典语医学问答任务上的表现正接近GPT-4等大型模型的性能。例如Qwen3.5-4B和Gemma4-E4B等模型在未经大量后期训练的情况下,在瑞典医学执业考试中展现出显著的准确性,其中Qwen3.5-4B的准确率达到87%。有趣的是,尽管提示是瑞典语,Qwen3.5-4B仍以英语进行推理,这表明对于这些模型而言,语言障碍不像之前认为的那样是主要障碍。

  2. RESEARCH · CL_95864 ·

    新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源

    近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…