PulseAugur
实时 10:59:05
实体 MedCalc-Bench Verified

MedCalc-Bench Verified

PulseAugur coverage of MedCalc-Bench Verified — every cluster mentioning MedCalc-Bench Verified across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_249510 ·

    通过Python代码执行增强LLM在临床数学方面的准确性

    研究人员开发了一种方法来提高大型语言模型在执行数学计算方面的准确性,特别是在临床应用中。模型不直接计算,而是生成Python代码,然后由受限的本地求解器执行。该方法在Qwen2.5模型上使用MedCalc-Bench Verified数据集进行了测试,结果显示较大的32B模型准确性显著提高,性能从83.47%提升到90.53%。虽然7B模型的增幅较小,但该研究强调了使用外部执行器来提高LLM在关键任务中的可靠性的潜力,但也指出公式验证…