mathematics-dataset
PulseAugur coverage of mathematics-dataset — every cluster mentioning mathematics-dataset across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法优化 LLM 评估小组以提高效率和准确性
一篇新的研究论文提出了一种优化大型语言模型(LLM)评估小组选择和部署的方法。该方法将评判小组设计为一个条件化角色分配问题,根据审计集和成本估算不同评判员的目标相对角色。这形成了一个策略,规定何时删除冗余评判员、添加互补评判员、有条件地路由专家,以及在验证收益减少时停止流程。该方法在推理、代码、安全和数学等多个领域进行了测试,证明了其在创建 LLM 评估的可重用和可审计调用计划方面的有效性。
-
新框架模拟LLM委托契约和技术选择
研究人员开发了一个新框架,用于模拟委托人-代理人问题,其中代理人从具有不同成本-能力特征的各种技术中进行选择。该模型特别适用于大型语言模型(LLMs),在这种模型中,代理人必须同时选择模型和努力程度,例如代币预算。该研究推导出了委托人的最优线性契约,表明阈值奖励份额可以激励代理人切换技术。该模型使用在MATH和MMLUPro基准测试上的开放权重LLMs进行了校准,表明简单的线性契约可以有效地管理代理工作流中的复杂委托。
-
《金融时报》指出数字素养低下是AI的盲点
《金融时报》强调了AI发展中的一个关键差距:数字素养低下。这种数学理解能力的不足构成了一个重大的盲点,可能阻碍人工智能技术的有效和负责任的进步。解决这个问题对于应对AI时代的复杂性至关重要。
-
Ethan Mollick:LLM通过综合不同思想正在革新科学
Ethan Mollick认为,大型语言模型(LLM)对科学产生的革命性影响,尤其是在数学领域,已经非常深远。他提出,LLM擅长以新颖的方式综合不同科学子领域的各种思想。Mollick认为,在LLM出现之前,科学正面临知识总量爆炸式增长导致的停滞,这阻碍了新发现并导致研究僵化。
-
新的蒸馏方法通过软提示高效训练大语言模型
研究人员开发了一种名为“通过软提示特权上下文进行多任务在线策略蒸馏”(“该方法”)的新方法来训练大语言模型。该技术使用一个仅通过可学习的软提示与学生模型不同的教师模型,从而在不改变学生模型核心参数的情况下实现高效的知识转移。多任务变体使单个学生模型能够同时从多个教师那里学习,从而提高在科学、工具使用、生物学和数学等各种任务上的性能。
-
新论文揭示:大型语言模型会继承叙事模式并提前承诺答案
近期研究论文探讨了叙事结构和经验抽象如何影响大型语言模型(LLM)的行为。一项研究表明,LLM会从训练数据中继承叙事模式,这可能带来潜在的对齐风险和意外行为。另一篇论文证明,LLM可以从其解决问题的过程中提取并利用自然语言抽象,从而提高推理任务的性能。第三篇论文强调,任务的叙事框架,而不仅仅是指定的角色,会显著影响LLM的行为,有时会对任务成功产生负面影响。最后,研究表明LLM可能在完全推理之前就承诺答案,即使答案与任务前提相矛盾,初…
-
新的SOS-LoRA方法提升了LLM在推理和数学任务上的性能
研究人员推出了一种新颖的参数高效微调方法SOS-LoRA,旨在提升大型语言模型的性能。该技术将总秩分解到多个低秩专家中,采用固定的多尺度缩放策略来分离优化动态,并通过正交初始化和正则化鼓励输入方向的多样性。在推理、知识和数学基准测试中,SOS-LoRA相比标准的LoRA和其他变体提供了持续的改进,并且在推理时不会引入额外的参数或延迟。
-
新的MASPRM模型在无需人工步级输入的情况下优化多智能体AI系统
研究人员开发了一个多智能体系统过程奖励模型(MASPRM),旨在优化多智能体系统中的计算使用。该模型对智能体之间的中间消息进行评分以识别进展,充当了诸如束搜索和蒙特卡洛树搜索等搜索算法的推理控制器。MASPRM仅使用最终结果奖励进行训练,无需人工步级标注。在GSM8K、MATH、MMLU和LogiQA等基准测试上的评估表明,MASPRM的表现优于尺寸匹配的Oracle奖励模型(ORM),并提高了排名质量。
-
研究:训练时长影响大型语言模型合并效果
一篇新的研究论文探讨了专家训练时长对将多个专家模型合并成一个更强大的大型语言模型的效果的影响。该研究挑战了在模型达到最佳验证损失时进行合并的标准做法,发现某些合并方法,特别是基于稀疏化的方法,在专家训练超出此点后表现更好。这表明应联合考虑训练时长和合并方法的选择以获得最佳结果,这与随机森林中高方差学习者的益处有相似之处。
-
AI撰写数学论文,人类难以理解
AI模型现在能够撰写数学论文,这一发展让人类研究人员难以理解生成的内容。这一进步引发了对当前教育体系在培养具备强大数学技能的人才方面的有效性的担忧,这些技能被形容为像湿纸巾一样脆弱。
-
KV-PRM论文提出高效的多智能体LLM奖励建模方法
研究人员提出了一种名为KV-PRM的新方法,用于提高多智能体系统中使用的过程奖励模型(PRM)的效率。与现有的重新编码整个轨迹的基于文本的PRM不同,KV-PRM直接利用LLM推理过程中生成的KV缓存。这种方法将计算成本从O(L^2)显著降低到O(L),使其更适合长上下文场景。在MATH、GSM8K和AIME等基准测试上的实证结果表明,KV-PRM在性能上能媲美或超越文本-PRM,同时在FLOPs、延迟和内存占用方面提供了显著的降低。
-
新的“表示作为评判者”方法使用小型模型进行评估
研究人员提出了一种新的语言模型评估方法,称为表示作为评判者(Representation-as-a-Judge),该方法利用小型模型的内部表示,而不是其生成输出。这种方法基于语义容量不对称性假说(Semantic Capacity Asymmetry Hypothesis),该假说认为评估所需的语义容量少于生成。提出的框架 INSPECTOR 利用了小型模型的这些内部特征来预测评估分数,为传统的 LLM 作为评判者方法提供了一种更有效…
-
DeepSeek V4 Pro 在基准测试中挑战 GPT-5 和 Claude 4,提供卓越价值 · 已追踪 2 个来源
2026年中期的新基准测试表明,中国的LLM提供商,特别是DeepSeek,在性能和成本效益方面已能与OpenAI和Anthropic的顶级模型相媲美甚至超越。例如,DeepSeek V4 Pro在编码和数学推理基准测试中处于领先地位,提供了显著更大的上下文窗口,并且比GPT-4o和Claude 4 Opus等模型便宜得多。虽然OpenAI的GPT-5.5 Max和Anthropic的Claude 4 Opus在特定任务上仍提供顶尖性…
-
AI日益增长的数学能力促使重新评估数学家角色
人工智能在执行数学任务方面的能力日益增强,促使人们重新评估数学家的作用。随着AI系统在解决复杂问题方面变得越来越熟练,人类数学家可能需要将重点转移到AI难以复制的领域,例如抽象推理、问题构建以及对AI生成结果的解释。这种不断变化的环境引发了对数学研究和教育未来的疑问,强调了适应和发展新技能的必要性。
-
AI时代引发关于数学研究未来的辩论
在先进人工智能时代,研究人员正在质疑传统数学在未来研究中的必要性。随着AI模型在执行复杂计算和解决问题方面的能力日益增强,一些学者正在辩论对数学原理的深刻理解是否仍将是科学进步的核心要求。这场讨论凸显了在快速发展的技术格局中,知识和技能的价值可能发生的转变。
-
研究发现AI数学推理基准存在“采样盲点”
一篇新发表在arXiv上的研究论文探讨了评估AI模型数学推理问题难度的关键局限性。研究表明,依赖于采样解决方案成功率(pass@k)的标准基准无法准确评估最难的问题。研究人员发现,通过残差流扰动确定性方法可以解决相当一部分被当前采样方法视为无解的问题,这表明这些问题并非本质上太难,而是未被典型的采样策略触及。
-
Nate Soares 提出高斯自然潜在空间研究方向
Nate Soares 提出了一个名为高斯自然潜在空间(Gaussian Natural Latents)的新研究方向,旨在开发一套严谨的概念和抽象理论。该方法利用高斯分布作为简化模型来推导具体定理,类似于物理学家使用“球形牛”来模拟复杂系统。该研究已取得初步成果,包括关于高斯系统中精确和近似自然潜在空间的存在性及其性质的定理,为理解更一般情况下的抽象提供了潜在途径。
-
新的EngTrace基准测试LLM的可验证工程推理能力
研究人员推出EngTrace,这是一个新的符号基准,旨在严格评估大型语言模型(LLM)的工程推理能力。与侧重于孤立技能的现有基准不同,EngTrace评估了科学原理、定量建模和工程任务所需的实际约束的整合。该基准包含90个参数化模板,涵盖三个工程分支和九个领域,生成超过1350个问题实例,并采用新颖的两阶段评估框架,在验证最终答案的同时验证中间推理过程。对27个LLM的评估揭示了数值精度和推理过程保真度之间的权衡,突显了一个复杂性鸿沟…
-
HRM-Text:拥有10亿参数的新型架构模型挑战LLM范式
Sapient Intelligence开发的一款名为HRM-Text的新语言模型,因其创新的架构而受到关注,该架构侧重于内部推理,而非仅仅增加模型规模或训练数据。该模型仅拥有10亿参数,训练成本约为1500美元,在MATH和GSM8K等基准测试中取得了令人印象深刻的分数。这种被称为分层推理模型(HRM)的架构强调潜在推理,允许模型在产生输出之前在其内部状态中执行多轮、分层和递归计算,这一概念也得到了Yoshua Bengio团队研究的探索。
-
Hard Fork 播客探讨人工智能对数学和首次公开募股的影响
最新一期的 Hard Fork 播客节目深入探讨了人工智能公司可能带来的“火热的首次公开募股季”,并研究了蓬勃发展的人工智能领域对传统数学的影响。讨论还涉及了一种新的人工智能应用“HatGPT”。