PulseAugur
实时 07:26:29
实体 MathVista

MathVista

PulseAugur coverage of MathVista — every cluster mentioning MathVista across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_210379 ·

    新基准揭示AI在绘制几何图方面存在困难

    一项名为“Solving Is Not Drawing”的新基准被引入,用于评估基础模型构建几何图的独特能力,这项技能与数学问题解决是分开的。该基准包含954个奥林匹克几何问题,每个问题都有一个用Asymptote代码渲染的相应图表。目前模型显示出显著的差距,在图表编译方面仅达到36.14%的成功率,表明强大的数学推理能力并不等同于准确的图表表示。

  2. RESEARCH · CL_193816 ·

    新的基准和模型应对 AI 生成的科学图 · 追踪 4 个来源

    研究人员开发了新的基准和模型来应对使用 AI 生成科学图的挑战。新的生成器 Princigram 采用结构化物理思维链 (SP-CoT) 方法,以确保物理图的物理保真度,并在大型带注释图像数据集上进行了训练。同时,引入了 Diagram-MMU 基准来评估多模态大语言模型 (MLLM) 在科学图解析和理解方面的能力,揭示了当前模型在图到代码任务方面存在困难。另一个基准 Math-Vision Diagrams 专门针对 LLM 的数学…

  3. RESEARCH · CL_147799 ·

    新的SD-MAR框架提升了VLM在多图像上的分析推理能力

    研究人员推出SD-MAR,一个旨在增强视觉语言模型(VLM)在多图像分析推理能力的新框架。该框架利用通过受控扰动生成的合成数据,为变化检测和定量比较等任务创建场景。通过采用一种名为GRPO-lite with Backward Discounted Allocation的强化学习方法,在SD-MAR上训练的模型在领域内准确性方面显示出显著的改进,其中Qwen2.5-VL-7B在基准测试中超越了GPT-4.1。至关重要的是,这些改进并未…

  4. TOOL · CL_117809 ·

    新数据集和模型以多样化视角增强多模态数学推理能力

    研究人员推出了 MathV-DP,这是一个旨在通过捕捉每个图像-问题对的多样化解题轨迹来改进多模态数学推理的新数据集。该数据集旨在提供比传统的一对一图像-文本配对更丰富的监督。他们还开发了 Qwen-VL-DP,一个基于 Qwen-VL 的模型,该模型使用监督学习和一种新颖的组相对策略优化(GRPO)方法。该方法结合了正确性辨别和多样性感知奖励,使模型能够从不同的推理视角中学习,并区分正确但不同的解法。在 MathVista 和 Ma…

  5. RESEARCH · CL_90818 ·

    研究发现:自改进的视觉语言模型可能在新任务上出现性能回退

    一项新的研究论文揭示,自改进的视觉语言模型(VLMs)可能在新任务上出现性能回退,这与更强的验证器总是能带来更强的学生模型的假设相反。研究发现,验证器的质量高度依赖于具体任务,在一个任务上提高性能的验证器实际上会在另一个任务上降低性能。这种回退是悄无声息发生的,即使在性能下降时训练损失也在减少,并且会被自信错误的偏好对所放大。

  6. TOOL · CL_79897 ·

    研究:第一阶段训练影响VLM熵,而非最终结果

    一篇新的研究论文探讨了不同第一阶段训练方法对视觉语言模型(VLM)的影响。研究发现,虽然第一阶段训练(如监督微调(SFT)或在线策略蒸馏(OPD))在域内表现相似,但它显著影响模型的熵模式。具体而言,与SFT相比,OPD导致更高的策略熵和答案多样性,尽管这些优势在第二阶段强化学习阶段后会减弱。

  7. RESEARCH · CL_18669 ·

    UnAC方法通过自适应提示增强LMM的复杂多模态推理能力

    研究人员推出了一种新颖的多模态提示方法UnAC,旨在增强大型多模态模型(LMM)在复杂视觉任务上的推理能力。该方法采用自适应视觉提示来帮助模型聚焦于相关图像区域,并使用图像抽象提示来提取关键信息。此外,UnAC还包含一个渐进式自我检查机制,用于验证分解的子问题的答案,从而提高整体推理准确性。

  8. RESEARCH · CL_04920 ·

    新的CGC框架提升多模态LLM的细粒度图像理解能力

    研究人员推出了一种名为组合式地面对比(CGC)的新框架,旨在增强多模态大语言模型(MLLMs)的细粒度多图像理解能力。该方法通过利用现有的单图像标注构建训练实例,解决了空间幻觉和物体恒常性等挑战。CGC利用跨图像和图像内对比学习,以及基于规则的空间奖励系统,来改进归因和对齐。该框架在MIG-Bench和VLM2-Bench等基准测试中展现了最先进的性能,并显示出对其他多模态任务的积极迁移学习效果。

  9. FRONTIER RELEASE · CL_02354 ·

    OpenAI 的新模型让 ChatGPT 能够用图像进行高级推理

    OpenAI 推出了其最新的视觉推理模型 o3 和 o4-mini,这些模型允许 AI 在其内部推理过程中“用图像思考”。这些模型能够原生执行图像操作,如裁剪和缩放,从而增强 ChatGPT 分析复杂视觉数据的能力。这一进展在多模态基准测试中取得了最先进的性能,尤其是在 STEM 问答和视觉搜索方面,标志着向更强大的多模态 AI 代理迈出了重要一步。