新发布的开放强化学习数据集MiMo-V2.6-RL-oss被发现与现有的CyberGym基准测试共享了相当一部分bug。这两个数据集都借鉴了OSS-Fuzz bug的ARVO集合,两者之间识别出223个相同的bug。然而,由于OSS-Fuzz中的bug重新编号,简单的ID连接只能检测到139个重叠,这凸显了基准测试比较中潜在的陷阱。分析表明,虽然一些重叠是预料之中的,但共享的bug数量略多于随机概率的预期,尽管这并不表明报告的分数被夸大了。 AI
影响 突出了强化学习代理基准测试有效性和可复现性方面潜在的问题。
排序理由 对两个开放强化学习数据集之间重叠的分析。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →