CLEVRER
PulseAugur coverage of CLEVRER — every cluster mentioning CLEVRER across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
前沿大模型高精度提炼答案集编程理论
一项新研究探索了使用神经符号方法从大型语言模型中提炼答案集编程(ASP)理论。该研究测试了九个模型,包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5 和 DeepSeek V4 Pro 等前沿模型,涵盖了 CLEVR、GQA 和 CLEVRER 三个基准。大多数前沿模型都取得了高精度,其中 Sonnet、Opus 和 DeepSeek V4 Pro 在 CLEVRER 上达到了 90% 以上的准确率…
-
新AI模型通过关注物理交互来学习因果视频预测
研究人员开发了一种交互感知JEPA(IA-JEPA)模型,旨在通过关注物理交互而非仅仅视觉纹理来改进因果视频预测。这种新方法采用以运动为中心的掩码策略,优先处理碰撞和动量传递等事件,迫使模型学习潜在轨迹。IA-JEPA在CLEVRER基准的因果推理任务上达到了14.26%的准确率,显著优于标准基线,并展示了通往理解物理因果的自监督世界模型的路径。
-
新的嵌合体训练方法增强了罕见违规的异常检测能力
研究人员开发了一种名为嵌合体训练的新型异常检测方法,当训练数据中违规情况罕见时特别有用。该方法使用一个神经规则评估器,将逻辑约束编译成带有MLP门的有向无环图。通过构建结合来自不同样本的子树特征的“嵌合体”,该方法可以在不需要实际异常图像的情况下生成监督式逻辑反例。该技术在CLEVRER、OpenImages和VidOR等数据集上表现出改进的性能,尤其是在复杂组合和关系规则方面。
-
新的世界模型方法在反事实推理方面表现出色
研究人员引入了确定性事件图基底,作为一种用于反事实推理的世界模型的新方法。这些基底将代理状态表示为RDF三元组的日志,并通过结构化干预进行分叉日志来处理反事实查询。该系统在CLEVRER等基准测试以及新的Smallville反事实基准测试上表现强劲,优于Llama-3.1-8B等模型。