PulseAugur
实时 06:42:10
实体 MATH benchmark

MATH benchmark

PulseAugur coverage of MATH benchmark — every cluster mentioning MATH benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_231469 ·

    神经符号AI旨在用数学知识为LLM奠定基础

    一篇新的研究论文探讨了如何利用形式化的领域本体为大型语言模型奠定基础,并以数学为例。该研究实现了一个神经符号管道,通过检索增强生成将来自OpenMath本体的相关定义注入模型提示中。在MATH基准上的评估表明,虽然本体驱动的上下文可以提高高质量检索的性能,但无关的上下文会显著降低结果,这突显了该方法的复杂性。

  2. TOOL · CL_30763 ·

    新型攻击诱导大型语言模型推理模型“过度思考”

    研究人员开发了一种新技术,利用大型语言推理模型(LRMs)中的一个漏洞,使其“过度思考”。该技术使用分层遗传算法生成输入,导致推理过程过长且冗余,从而增加了延迟和资源消耗。该攻击在MATH基准测试中显示输出长度显著增加,最高可达26.1倍,并对各种最先进的模型显示出有效性,凸显了改进针对此类拒绝服务攻击的防御措施的必要性。