实体
MedAgentBench
MedAgentBench
PulseAugur coverage of MedAgentBench — every cluster mentioning MedAgentBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新AI论文介绍用于扩展AI的无训练验证器
斯坦福大学、NVIDIA和加州大学伯克利分校的一篇新研究论文介绍了一种用于AI模型的无训练验证器。该验证器提供的是连续、校准过的分数,而不是离散的等级,从而提高了各种领域的准确性。该论文证明,调整分数粒度、使用重复评估和分解标准可以在不进行微调的情况下提高性能。连续分数还可以作为强化学习算法的密集奖励和任务进度信号。
-
新框架将LLM验证视为一个可扩展轴
研究人员推出了一种名为“LLM-as-a-Verifier”的新颖框架,该框架将验证视为大型语言模型的一个新的可扩展轴。这种方法超越了离散评分,通过计算基于token logit分布的连续分数来实现,从而为代理任务提供更细粒度的反馈。该框架在Terminal-Bench V2和SWE-Bench Verified等多个基准测试中展示了最先进的性能,并且还可以提供任务的进度估计。此外,它还被集成到Claude Code中,以帮助开发人员…
-
新基准揭示临床人工智能代理训练中的局限性
研究人员在现有的临床人工智能代理基准 MedAgentBench v1 和 v2 中发现了显著的局限性。他们发现存在很高的静默完成率,这会激励强化学习(RL)代理不采取行动。为解决此问题,他们开发了 MedAgentBench-v3 (MAB-v3),并降低了静默完成率的上限。在 MAB-v3 上训练 Qwen3_8B 模型揭示了进一步的挑战,包括模型在某些任务类型上遇到困难的能力上限,以及需要精确临床代码的格式知识障碍。