PulseAugur
中
实时 07:41:44
实体 mathematics-dataset

mathematics-dataset

PulseAugur coverage of mathematics-dataset — every cluster mentioning mathematics-dataset across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
64
90 天内 64
发布 · 30天
0
90 天内 0
论文 · 30天
49
90 天内 49
层级分布 · 90 天
主题
情绪 · 30 天

13 天有情绪数据

最近 · 第 1/4 页 · 共 68 条
  1. TOOL · CL_284606 ·

    新的 RLVR 方法为语言模型训练提供差分隐私保护

    研究人员开发了一种新颖的方法,在满足提示级别差分隐私的同时,使用可验证奖励(RLVR)的强化学习来训练语言模型。该方法确保发布的模型权重对于单个训练问题是差分私有的。该方法聚合梯度、裁剪贡献、添加高斯噪声并组合隐私损失,提供了已知的首个 RLVR 训练的差分隐私保证。使用 Qwen2.5-1.5B-Instruct 进行的实验表明,即使在隐私限制下,奖励信号也能显著提高 MATH 和 GSM8K 等数学任务的准确性,其性能优于有监督微…

  2. RESEARCH · CL_284206 ·

    OpenAI 发布 AI 生成的数学研究目录

    OpenAI 发布了一个公共存储库,其中包含由内部 AI 模型生成的数学研究和证明工件的目录。该集合包括 722 篇手稿,分为 372 个家族,涵盖各种数学学科。虽然大多数结果是使用未发布的模型的标准程序生成的,但一些具体发现,例如黎曼 zeta 函数的无零区域和关于霍奇猜想的工作,涉及人工编辑或不同的程序。该存储库旨在提供模型数学能力的验证记录,并计划包含更多形式化和社区贡献。

  3. RESEARCH · CL_284014 ·

    OpenAI 发布 700 篇数学证明和反例预印本

    OpenAI 发布了一个包含 700 篇数学证明和反例的预印本合集。这个庞大的数据集现已在 GitHub 上提供,为数学和人工智能领域的研究人员提供了重要的资源。此次发布旨在通过提供详细的示例和证明以供进一步研究和开发,来推动该领域的发展。

  4. TOOL · CL_277350 ·

    新研究解释GRPO归一化在自适应梯度中的作用

    一篇新研究论文探讨了组相对策略优化(GRPO)中归一化的必要性和有效性。GRPO是语言模型强化学习的标准算法。该研究发表在arXiv上,理论上证明了GRPO的归一化充当自适应梯度,提高了比标准REINFORCE方法更快的收敛速度。研究人员还引入了重要性采样变体IS-GRPO,并在GSM8K和MATH数据集上进行了实证验证,尤其是在每提示方差异构的情况下,显示出性能提升。

  5. TOOL · CL_273448 ·

    SpecScale 系统通过高效的推测执行增强 LLM 推理能力

    一个名为 SpecScale 的新系统已被开发出来,以提高大型语言模型 (LLM) 服务效率,特别是在需要数学和编码等复杂推理的任务中。推测执行(simultaneously explores multiple reasoning paths)会带来挑战,例如候选路径过多和频繁的验证需求。SpecScale 通过早期修剪低质量路径、去重计算和延迟详细验证等技术解决了这些问题。在 MATH 和 Olympiad 等基准测试上的评估表明,…

  6. TOOL · CL_273167 ·

    新框架ANI将LLM数值推理能力提升9.5个百分点

    研究人员推出了一种名为自适应数值注入(ANI)的新型框架,旨在提高大型语言模型(LLMs)的数值推理能力。ANI通过根据语义上下文选择性地注入数值特征,解决了文本分词中数字碎片化以及数值嵌入的上下文无关性问题。这种混合方法使用上下文感知门控机制来保留名词标识符,同时增强定量操作数。评估表明,ANI在不影响通用语言基准测试的情况下,使MATH性能比基线模型提高了9.5个百分点。

  7. TOOL · CL_269270 ·

    AI模型解决数学问题的能力通过专门数据集进行测试

    研究人员正在探索在特定数学数据集上训练的AI模型的能力。提出的一个问题是,仅在中学数学上训练的AI是否能解决高中水平的问题。这一探究旨在了解AI在接触有限、特定领域训练数据时的泛化能力。

  8. RESEARCH · CL_267137 ·

    AI 研究在数学、适应性和公平性方面推进强化学习 · 跟踪 10 个来源

    研究人员正在探索先进的强化学习技术,以提高 AI 的数学推理和适应能力。一篇论文介绍了函数结构图强化学习 (FSG-RL),通过从函数图生成代码并使用多验证器反馈来增强数学问题解决能力,显著提高了准确性。其他研究侧重于通过样本重用来优化近端策略优化 (PPO),并探索用于测试时适应的无数据方法。此外,还在开发无监督强化学习、具有神经进化的持续学习以及将公平性与 AI 系统的可解释性相结合的新方法。

  9. TOOL · CL_259330 ·

    新方法通过执行验证提升大语言模型数学推理能力

    研究人员开发了一种新方法,通过结合基于执行的验证和依赖感知过滤来提高大语言模型的数学推理能力。该方法生成具有依赖图的计算上可靠的解决方案,增强了科学任务的偏好优化。当应用于 Llama-3-8B 和 DeepSeekMath-7B 时,该方法在 MATH 和 GSM8K 基准测试上取得了显著的改进。此外,扩展此框架在 PhyX 多模态物理推理任务上取得了最先进的成果,展示了高度的科学有效性并减少了科学定律的违规行为。

  10. TOOL · CL_254638 ·

    新的强化学习研究揭示了奖励塑造和过滤中的关键缺陷

    一篇新的研究论文强调了群体相对强化学习(RL)方法中的一个关键缺陷,特别是在使用奖励塑造时与“过滤器指标”相关。研究表明,如果过滤机制优先考虑塑造后的训练分数而不是实际任务结果,就可能导致“幻影优势”。这是因为那些未能完成任务但由于奖励塑造而得分高的群体仍然可以通过过滤器,人为地夸大了它们的可感知性能,并可能误导学习过程。该论文建议使用与塑造无关的任务结果信号进行过滤,以确保更可靠和准确的RL代理训练。

  11. COMMENTARY · CL_252535 ·

    AI与数学阅读材料分享 2026年9月7日至13日

    此集群包含一项关于2026年9月7日至13日期间分享的与AI和数学相关的阅读材料的条目。分享的内容似乎是一个精选的资源或文章列表,URL指向一个“readings_shared”页面。

  12. TOOL · CL_252023 ·

    新基准MMGR测试超越视觉流畅性的多模态AI推理能力

    研究人员推出了MMGR,这是一个新的基准,旨在评估多模态生成模型在视频、图像和语言输出方面的推理能力。该基准在抽象推理、具身导航和物理常识等领域的十项任务中,评估了五种关键的推理能力:物理、逻辑、二维空间、三维空间和时间。对最先进模型的初步评估显示,视觉输出质量与实际推理正确性之间存在显著差距,模型在数独和数学等符号任务上表现不佳,在导航任务中表现脆弱。

  13. SIGNIFICANT · CL_249640 ·

    GPT-6 Astra攻克最后一道FrontierMath Tier 4数学难题 · 跟踪1个来源

    GPT-6 Astra已成功解决了FrontierMath Tier 4基准测试中最后一道剩余的难题,该基准测试包含一系列旨在挑战先进AI模型的科研级数学问题。这一成就标志着一个重要的里程碑,因为该严格测试套件中的所有问题现在都至少被AI解决过一次。尽管Astra的直接得分是97.6%,但它在之前未解决问题上的突破意味着FrontierMath Tier 4基准测试现在被认为是饱和的,AI展示了先进的数学推理能力。

  14. COMMENTARY · CL_245924 ·

    AI 攻克复杂数学难题,引发生存危机和安全担忧

    AI 已经展现出解决复杂数学问题的非凡能力,包括可能攻克千禧年大奖难题,这引发了对其能力和潜在风险的担忧。虽然 Anthropic 的 'fable' 等 AI 工具在证伪数学猜想方面发挥了重要作用,但关于 AI 的问题解决能力是否会掩盖数学中概念理解和洞察力的关键目标,存在更广泛的讨论。这一发展导致了一项声明,警告称 AI 对智力工作的影响可能与其他科学和创意领域面临的挑战相呼应,有可能在不失去其原始目的的情况下改变工作方式。

  15. TOOL · CL_245335 ·

    Qwen2.5模型在数学任务中显示出相关的验证器错误 · arXiv论文

    一篇新论文研究了Qwen2.5-1.5B模型生成的完成组内验证器错误的独立性。该研究分析了多个数学数据集上近25,000组八个完成项,发现组内验证器错误具有显著的0.530的相关性。这种依赖性因答案格式而异,分数和符号表达式比单位注释显示出更强的聚类。研究结果表明,对验证器噪声的分析应考虑提示难度和答案形式,而不是仅仅依赖于聚合错误率。

  16. COMMENTARY · CL_243332 ·

    AI 数学突破引发争议 · 已追踪 4 个来源

    一个人工智能模型在解决复杂数学问题方面取得了重大突破,但这一进展引发了争议。该 AI 解决以前棘手的数学难题的能力引起了科学界的质疑和担忧。争议的具体性质和涉及的具体 AI 模型并未详细说明,但其核心在于这种数学能力的潜在影响。

  17. COMMENTARY · CL_242296 ·

    AI数学突破戏剧性事件引发归属和数据争论

    数学界围绕归属和AI模型的训练数据使用问题爆发了争议。一位数学家对OpenAI提出的指控引发了广泛辩论,凸显了AI开发中对知识产权和数据来源的担忧。

  18. RESEARCH · CL_244677 ·

    新研究强调了人工智能评估方法的局限性

    一篇新论文探讨了机器学习中 pass@k 评估的局限性,特别是在外推到超出收集样本数量的范围时。研究表明,条件二项式模型中的固定 n 成功计数只能识别潜在的每任务成功分布的有限范围。这意味着即使有大量任务,外推到 k > n 的 pass@k 值也无法可靠地识别。该研究使用 Brown 等人的数据集,展示了反事实评估如何导致失败率的显著模糊性。

  19. TOOL · CL_240254 ·

    Spark-X2.5 LLM 荣登 Hugging Face 排行榜榜首,启动数学推理挑战赛

    Spark-X2.5,一个大型语言模型,已荣登 Hugging Face 热门模型榜单榜首。为进一步测试其能力,开发者正在启动 Spark-X2.5 数学推理挑战赛。鼓励参赛者使用各种基准和方法来评估模型的数学推理能力,提交时间为 2026 年 9 月 7 日至 9 月 13 日。

  20. TOOL · CL_239422 ·

    新框架在性能、延迟和内存方面评估开放LLM

    一篇新的研究论文提出了一个面向推理的开放语言模型的统一评估框架,超越了简单的准确性指标。该研究在四个基准测试中测试了七种模型配置,不仅分析了准确性,还分析了延迟、内存使用和提示敏感性。Gemma-4-26B-A4B 获得了最高的加权分数,而 Gemma-4-E4B 在性能和效率之间取得了良好的平衡。研究结果表明,模型排名会根据提示策略而变化,并且特定于部署的权衡对于实际选择至关重要。