实体
Terminal-Bench V2
Terminal-Bench V2
PulseAugur coverage of Terminal-Bench V2 — every cluster mentioning Terminal-Bench V2 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
LLM-as-a-Verifier 在 AI 基准测试中取得高分
一种名为 LLM-as-a-Verifier 的新方法在 AI 评估基准测试中表现出色。该方法将验证 AI 生成的答案视为一个关键的扩展领域,在 Terminal-Bench V2 上达到了 86.5% 的准确率,在 SWE-Bench Verified 上达到了 78.2%。值得注意的是,它在无需额外训练的情况下达到了这些分数。
-
新AI论文介绍用于扩展AI的无训练验证器
斯坦福大学、NVIDIA和加州大学伯克利分校的一篇新研究论文介绍了一种用于AI模型的无训练验证器。该验证器提供的是连续、校准过的分数,而不是离散的等级,从而提高了各种领域的准确性。该论文证明,调整分数粒度、使用重复评估和分解标准可以在不进行微调的情况下提高性能。连续分数还可以作为强化学习算法的密集奖励和任务进度信号。
-
新框架将LLM验证视为一个可扩展轴
研究人员推出了一种名为“LLM-as-a-Verifier”的新颖框架,该框架将验证视为大型语言模型的一个新的可扩展轴。这种方法超越了离散评分,通过计算基于token logit分布的连续分数来实现,从而为代理任务提供更细粒度的反馈。该框架在Terminal-Bench V2和SWE-Bench Verified等多个基准测试中展示了最先进的性能,并且还可以提供任务的进度估计。此外,它还被集成到Claude Code中,以帮助开发人员…