CLEVR
PulseAugur coverage of CLEVR — every cluster mentioning CLEVR across labs, papers, and developer communities, ranked by signal.
-
量子模型利用多阶段训练实现组合泛化
研究人员开发了一种新的多模态学习组合模型,该模型利用变分量子电路和多阶段训练范式。该方法将名词与关系分离,首先学习对象表示,然后将其转移到仅优化关系组件的关系阶段。该模型在 CLEVR 数据集上进行了测试,并使用了来自 OpenAI 的 CLIP 嵌入,与经典方法相比,在分布外关系泛化方面表现出显著的改进,并且可训练参数明显更少。
-
新框架ChartProbe通过训练更简单的技能来提升VLM的视觉推理能力
研究人员开发了ChartProbe,一个旨在提高视觉语言模型(VLM)视觉推理能力的诊断框架。该框架将感知和关联等更简单的技能分离出来进行训练,而不是仅仅关注复杂的推理监督。通过在这些基础技能上微调VLM,研究发现即使没有直接针对复杂图表问题进行训练,它们回答这些问题的能力也得到了显著提高。在各种图表类型甚至非图表视觉领域中都观察到了这些进步,这表明基础技能的发展是增强复杂视觉推理的关键。
-
新的ReRef-3D基准测试AI在3D场景中放置物体能力
研究人员推出了ReRef-3D,一个旨在评估语言引导的3D环境物体放置能力的新基准。该基准包含超过33,000条指令,覆盖近1,000个场景,侧重于各种指代复杂性。初步评估显示,LLaVA-3D取得了最高性能,在68.3%的情况下正确放置了物体,显著优于3D-LLM和PlaceIt3D。研究还发现,诸如“最近”或“之间”等关系性难度对当前模型构成了最大挑战。
-
DSeq-JEPA架构通过顺序预测增强视觉表示学习
研究人员推出了一种新颖的自监督视觉表示学习架构DSeq-JEPA。该模型在基于图像的联合嵌入预测架构(I-JEPA)的基础上,通过引入判别式顺序预测过程。DSeq-JEPA首先关注重要的视觉区域,然后逐步预测后续区域,模仿人类的注意力。在图像分类和目标检测等多个基准测试中的实验表明,DSeq-JEPA比其前身学习到更鲁棒、更具泛化性的表示。
-
前沿大模型高精度提炼答案集编程理论
一项新研究探索了使用神经符号方法从大型语言模型中提炼答案集编程(ASP)理论。该研究测试了九个模型,包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5 和 DeepSeek V4 Pro 等前沿模型,涵盖了 CLEVR、GQA 和 CLEVRER 三个基准。大多数前沿模型都取得了高精度,其中 Sonnet、Opus 和 DeepSeek V4 Pro 在 CLEVRER 上达到了 90% 以上的准确率…
-
新的EditCLEVR基准测试AI对象中心表示的忠实度
研究人员推出EditCLEVR,一个旨在评估AI模型中对象中心表示的组合忠实度的新基准。该基准使用具有受控语义编辑的配对场景来评估模型识别和修改特定对象属性的准确性。EditCLEVR旨在提供对干预下每个对象表示行为的更直接测试,超越传统的分割或预测准确性指标。初步评估表明,即使有真实掩码,也可能发生降级,并且现有方法可能夸大语义忠实度。
-
新的基于精灵的深度模型在图像分割方面达到SOTA水平
研究人员开发了一种新颖的基于深度精灵的图像分解方法,其性能可与最先进的无监督类别感知图像分割相媲美。这种新方法在识别对象类别和以可解释的方式对图像进行建模方面表现出色。它展示了与对象数量的线性可扩展性,解决了先前基于精灵模型的关键限制。
-
新的IDEAL-Bench评估视觉语言模型中的3D布局推理能力
研究人员推出了IDEAL-Bench,这是一个旨在评估视觉语言模型(VLMs)3D布局推理能力的新评估套件。该基准测试使用了一个包含1000个程序生成Blender环境的数据集,称为IDEAL-Scenes,用于测试VLMs在室内场景中预测物体姿态和范围的能力。对15个VLMs的初步评估显示,该任务仍未得到充分解决,表现最好的模型仅获得100分中的62.1分,并突显了当前模型在物体识别和几何回归能力之间存在显著差异。
-
新的Gen-VCoT框架为多模态AI生成视觉推理步骤
研究人员推出Gen-VCoT,一个旨在通过生成视觉思维链(CoT)推理步骤来增强多模态大语言模型(MLLMs)的新型框架。与依赖文本CoT或不透明令牌的现有方法不同,Gen-VCoT利用专家视觉模型生成可解释的RGB图像作为中间推理表示。该方法包括使用SAM进行视觉接地、使用Marigold深度图进行几何推理以及与Qwen2-VL集成的语义推理,并由一个自适应路由器控制推理深度。虽然Gen-VCoT在空间和深度相关问题上显示出显著的改…
-
新的大型语言模型研究增强了超越符号模式的空间推理能力
研究人员正在开发新的方法来提高大型语言模型(LLM)的空间推理能力,方法是超越符号模式匹配,实现真正的几何理解。一种方法引入了空间语言模型(SLM),它将位置视为一等模态,并使用专门的数据集和基准进行训练和评估。另一种方法,想象感知令牌(IPT),通过允许多模态模型推断未见的空间配置来增强它们,从而提高路径跟踪和多视图计数等任务的性能。此外,研究还在调查语言偏差的影响以及度量空间接地对LLM空间预测的重要性。
-
新论文揭示AI模型中特征组合的几何限制
一篇新论文探讨了Transformer模型中特征组合的理论局限性,特别关注稀疏自编码器(SAEs)。研究人员开发了一个几何框架来分析非线性干扰效应如何在多个语义特征同时激活时导致不稳定性。研究表明,由于这些干扰现象,当前方法可能面临可扩展性问题,并提出需要能够主动管理这些效应的组合机制。
-
Apple 研究人员为扩散模型泛化识别局部分数
Apple 的研究论文探讨了条件扩散模型中组合泛化机制,特别关注这些模型如何处理生成比训练时更多的对象的图像。研究确定“局部条件分数”是实现此能力的关键因素,表明成功进行长度泛化的模型表现出这些分数,而失败的模型则没有。研究还提出了一种强制执行这些局部分数的方法,该方法成功地使先前表现不佳的模型实现了长度泛化。