PulseAugur
中
实时 01:01:08
实体 V-JEPA 2

V-JEPA 2

PulseAugur coverage of V-JEPA 2 — every cluster mentioning V-JEPA 2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
21
90 天内 21
发布 · 30天
0
90 天内 0
论文 · 30天
17
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 21 条
  1. TOOL · CL_286910 ·

    新的Market-1T数据集赋能更深入的金融世界建模

    研究人员推出了Market-1T,这是一个包含2008年至2025年间近一万亿条美国股票1赫兹分辨率观测数据的大型数据集。该数据集以及严格的评估协议,促进了对金融表征学习策略的大规模研究。研究结果表明,不同的训练方法可以带来相似的预测性能,但会导致市场状态的不同组织结构,为金融世界模型奠定了基础。

  2. TOOL · CL_284555 ·

    研究发现视频世界模型难以追踪隐藏物体

    研究人员调查了视频世界模型在物体不再可见时保留信息的能力。使用 V-JEPA 2 进行的实验显示,这些模型在保持对静止物体(尤其是在容器内的物体)的认知方面存在困难,并且在几秒钟内就会丢失对移动物体的追踪。虽然编码器仍能解码隐藏物体的存在,但预测器的输出显示该信息严重退化。研究表明,训练可以植入物体恒存的概念,从而提高在 IntPhys-2019 等基准测试上的表现,但具体的训练方法及其对基准测试的影响仍需进一步考察。

  3. TOOL · CL_282419 ·

    JEPA-Anything 框架统一了 7 个领域的 عالم 模型创建

    研究人员推出了一种新颖的领域无关框架 JEPA-Anything,用于构建 عالم 模型。该框架通过引入正交预测因子分解 (OPF) 来扩展联合嵌入预测架构 (JEPA),OPF 将单个预测目标分解为多个正交因子,每个因子都有自己的专用预测器。这种方法在包括视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气在内的七个不同领域都展示了改进的性能,在许多动力学任务上优于标准的 JEPA 基线。

  4. RESEARCH · CL_267611 ·

    新研究增强了机器人和AI的世界动作模型

    近期研究探索了用于机器人和AI的世界动作模型(WAMs)的进展,重点是提高预测精度、动作生成和推理效率。几篇论文介绍了新的方法,如完成感知引导(CAG)以确保任务完成,回顾性世界建模以实现向后推理,以及动作经验字典(AED)以实现技能重用。其他工作通过诸如动作引导稀疏想象(Sparse-WAM)和带有阶梯策略的流式推理等技术来解决计算成本问题。这些创新旨在提高机器人控制、泛化能力和在复杂环境中的鲁棒性。

  5. TOOL · CL_257194 ·

    新的 MoE-JEPA 模型在合成图像检测方面达到最先进水平

    研究人员开发了 MoE-JEPA,一种用于检测合成和篡改图像的新型双流架构。该模型通过残差混合专家机制和噪声流分支增强了 V-JEPA 2 主干,以动态学习取证知识。在 SID-Set 基准测试中,MoE-JEPA 达到了 95.54% 的新最先进准确率,在识别 deepfakes 方面优于更大的模型。

  6. TOOL · CL_245087 ·

    新的CALIPER基准揭示了AI物理理解能力的局限性

    研究人员开发了一个名为CALIPER的新基准,以更准确地评估预训练视觉模型的物理推理能力。使用干净、静态场景的传统方法未能区分真正理解物理的模型和仅仅依赖视觉线索的模型。CALIPER引入了一个更具挑战性的测试,模型必须预测物体被击中后的滑动距离,即使在信息不完整或校准数据被交换的情况下,也揭示了显著的性能差异。

  7. TOOL · CL_244781 ·

    新的ARC-Bench协议揭示了冻结JEPA世界模型的关键缺陷

    研究人员开发了ARC-Bench,一个旨在评估冻结潜在世界模型动作排序能力的新评估协议。研究发现,这些通过根据预测的未来嵌入对候选动作进行评分来进行规划的模型,常常无法正确排序动作。由于闭环重规划机制,这一缺陷在很大程度上未被发现,导致次优的动作选择,并夸大了潜在表征的真实性能。即使使用不同的视觉骨干网络,包括V-JEPA 1和V-JEPA 2,研究结果也保持一致。

  8. RESEARCH · CL_242973 ·

    新的AI模型通过改进的记忆和规划能力推动机器人操作发展

    研究人员开发了新的机器人操作方法,提高了在长时任务中的性能。2AM系统将任务记忆与动作模型分离,实现了更精确的控制,并在LIBERO-Mem数据集上比现有基线提高了61.5分。DUET-DINO是另一项进展,它使用同时跨视图世界建模来增强潜在规划,实现完整的7-DoF末端执行器控制,在到达任务上以高达92%的成功率超越了单视图模型。GE-Act 2.0专注于从头开始预训练和扩展世界-动作模型,通过更多的训练数据展示了显著的成功率提升,…

  9. TOOL · CL_231717 ·

    视频基础模型在时空理解方面的分析

    研究人员分析了两个视频基础模型 V-JEPA 2 和 VideoMAE-v2,以了解它们在时空方面的表示。研究发现,这两个模型都能有效地编码相机运动,并在异常检测方面表现出中等水平的性能,但在直观物理任务方面存在困难,这表明它们对物理原理的推理能力有限。此外,研究还揭示了视频中的时间特征在模型的表示空间中形成平滑的轨迹,从而能够进行几何感知引导以实现更平滑的视频插值。

  10. TOOL · CL_220307 ·

    Meta AI 的 V-JEPA 2:一种新的世界模型方法

    Meta AI 开发了 V-JEPA 2,这是一种新颖的世界模型,与典型的生成模型不同。与专注于生成新数据的模型不同,V-JEPA 2 优先考虑理解和预测世界的底层结构。这种方法对于机器人和自动驾驶等领域的应用尤为重要,因为准确的世界表征对于有效的决策和行动至关重要。

  11. TOOL · CL_210796 ·

    招商局AI实验室推出柔性物体操控技术

    招商局集团先进技术研究院旗下的山海关人工智能实验室,公布了其在具身智能和柔性物体操控方面的全栈自研能力。在2026世界机器人大会上,该实验室展示了服装自主折叠的解决方案,表明其有能力弥合模拟与现实世界机器人执行之间的差距。其专有的LiOS云边协同基础设施被强调为使大型模型能够在物理机器人上执行复杂任务的关键,该系统在ICRA 2026 LeHome挑战赛中获得第一名。

  12. TOOL · CL_154567 ·

    JEPA 预测器被证明可用于遮挡特征补全

    研究人员已经证明,联合嵌入预测架构 (JEPA) 中通常在训练后被丢弃的预测器组件,可以作为可迁移算子重新用于遮挡特征补全。通过将冻结的 JEPA 预测器通过简单的线性投影连接到 CLIP、DINOv3、DINOv2 和 MAE 等非 JEPA 主编码器上,在 ImageNet 和 Stanford Dogs 等任务上的性能得到了显著提升,尤其是在严重遮挡的情况下。这种方法可以在不重新训练原始模型的情况下实现增强的特征补全,突显了 J…

  13. RESEARCH · CL_145738 ·

    VideoRAE 利用 VFM 特征改进视频生成

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强视频生成模型。该系统利用了 V-JEPA 2 和 VideoMAEv2 等冻结的视频基础模型 (VFM) 的特征,将它们压缩成适合生成任务的紧凑潜在表示。VideoRAE 同时支持用于扩散 Transformer 的连续潜在表示和用于自回归模型的离散标记,在 UCF-101 数据集上展示了最先进的性能,并且比现有方法收敛更快。

  14. TOOL · CL_152126 ·

    VideoRAE 利用冻结的基础特征增强生成式视频模型

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强生成式视频建模。与专注于像素级重建的传统方法不同,VideoRAE 利用来自 V-JEPA 2 和 VideoMAEv2 等冻结视频基础模型的多尺度分层特征。这种方法可以创建紧凑、有利于生成的潜在空间,支持 Diffusion Transformers 的连续潜在变量和自回归模型的离散标记。实验表明,VideoRAE 实现了最先进的重建质量,并且比现有的自编码器基线收…

  15. TOOL · CL_128831 ·

    新的PULS系统使用语义世界模型管道预测视频异常

    研究人员开发了PULS(预测统一潜在空间),一种用于连续视频异常检测的新型管道,它超越了被动响应方法。PULS由KSD桥组成,该桥使用Qwen3-VL-Embedding-2B将V-JEPA 2的物理张量转换为文本对齐的超球体,以及一个预测状态预测器(ASP)。这种方法在UCF-Crime和XD-Violence等数据集上取得了出色的性能,证明了潜在清晰度假说,即预期的未来表征比当前表征在语义上更易分离。ASP模块进一步完善了这些预期…

  16. TOOL · CL_121092 ·

    新的 Cross4D-JEPA 方法蒸馏 2D 模型以理解 4D 点云

    研究人员推出了一种新颖的自监督学习方法 Cross4D-JEPA,用于理解动态 4D 点云。该方法将来自 DINOv2 和 V-JEPA 2 等 2D 图像或视频基础模型的知识蒸馏到一个 4D 点编码器中。Cross4D-JEPA 利用密集的跨模态对应关系将 3D 点映射到教师块特征,训练学生编码器以匹配这些特征,而无需掩码、负样本或解码器。与单模态和全局跨模态基线相比,该方法在 MSR-Action3D 和 NTU RGB+D 60…

  17. RESEARCH · CL_118078 ·

    新研究推动机器人和AR三维场景图生成技术

    三篇新研究论文介绍了生成三维语义场景图的先进方法,这对于理解和与三维环境交互至关重要。DeWorldSG 利用世界模型先验和概率三维节点来提高时间一致性和关系准确性。NoPA 专注于非参数对象表示和定制化的合并策略,以实现实时推理而不牺牲几何细节。OP3DSG 引入了一个开放词汇、部件感知的框架,该框架联合建模对象、部件和各种关系,并提供了一个新的评估基准。

  18. TOOL · CL_77409 ·

    AI通过视频预测关节力,绕过侵入性方法

    研究人员开发了一种新颖的流程,能够从单目视频中预测体内关节接触力,而无需侵入性测量或特定于受试者的模型。该系统利用参数化身体网格和Transformer模型,并结合自监督视频令牌,来准确估计髋部和膝部的力。该方法实现的准确性可与复杂的肌肉骨骼模拟相媲美,并有望在临床应用中发挥作用,例如回顾性分析和居家康复跟踪。

  19. RESEARCH · CL_68572 ·

    TrAction 使用稀疏轨迹实现高效动作识别

    研究人员开发了 TrAction,一种新颖的 Transformer 架构,用于使用稀疏点轨迹而非密集视频进行动作识别。该方法旨在减少依赖外观或背景线索的传统模型中存在的偏差。TrAction 在 Something-Something V2 和 EPIC-Kitchens-100 等基准测试中取得了有竞争力的准确率,并且与其他模型融合后,性能得到进一步提升。

  20. RESEARCH · CL_64798 ·

    狮山实验室发布LiOS,连接云端AI模型与机器人

    招商局狮山人工智能实验室的研究人员开发了LiOS系统,旨在弥合云端AI模型与现实世界机器人应用之间的差距。该系统解决了将大型语言模型与机器人硬件集成所带来的复杂性以及对计算资源的持续需求。LiOS为具身AI模型提供了一个闭环迭代流程,能够实现高效的数据收集、模型训练和在实体机器人上的部署。