PulseAugur
中
实时 22:56:00
实体 V-JEPA

V-JEPA

PulseAugur coverage of V-JEPA — every cluster mentioning V-JEPA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
23
90 天内 23
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 25 条
  1. TOOL · CL_275080 ·

    STATERA模型使用冻结的时间表示从视频中估计隐藏质量

    研究人员开发了STATERA,一种从单目短视频估计不透明、非对称刚体质心(CoM)的新颖方法。该方法通过使用大部分冻结的权重和一个轻量级的时间管状结构混合器来调整预训练的视频骨干网络V-JEPA,以预测每帧的CoM热图和轨迹。为了促进这项研究,创建了HiddenMass Benchmark,其中包含5万个模拟轨迹和一个具有校准CoM真实值的63个序列的真实世界测试集。STATERA在模拟中显示出更高的准确性,并在面对监督信号挑战时,在…

  2. TOOL · CL_259500 ·

    AI City Challenge 2026:新框架通过解耦语义理解获胜

    研究人员开发了一种新颖的交通场景理解框架,该框架将语义事实提取与自然语言生成解耦,解决了现有视觉-语言模型中存在的幻觉和推理不一致问题。该方法首先使用 V-JEPA 编码器和基于 Llama 的预测器将交通问题解析为结构化语义事实,然后使用统计先验和时间一致性检查来完善这些事实。最后,完善后的事实指导 Qwen3-VL-8B 模型生成准确的交通事件描述。该方法在 AI City Challenge 2026 中获得第一名,在视觉问答和…

  3. TOOL · CL_257173 ·

    肺部超声人工智能研究比较自监督学习方法

    一篇新的研究论文探讨了不同自监督学习(SSL)预训练任务在肺部超声(LUS)图像分析中的有效性。该研究使用相同的编码器骨干和预训练语料库,比较了对比学习(MoCo)、掩码重建(VideoMAE)和联合嵌入预测架构(V-JEPA)。结果显示,VideoMAE和V-JEPA在POCUS数据集上表现更好,而MoCo在独立获取的Mendeley-Uganda数据集上表现更优,这表明在一个数据集上的表现不能保证迁移到其他数据集。研究人员计划进行…

  4. TOOL · CL_245690 ·

    新的Arti-JEPA模型将视频模型适配于声谱图MRI分析

    研究人员开发了Arti-JEPA,一种新的联合嵌入预测架构,旨在对声谱图的实时MRI数据进行建模,以进行语音分析。该模型在约62小时的无标签声谱图视频上进行了训练,并在包括音素预测、流畅与不流畅语音分类以及手术后语音变化特征描述等任务上进行了评估。研究结果表明,时间视频先验比逐帧编码器更有效,并且领域适应对于音素预测等某些任务至关重要,尽管它并未改善口吃分类。Arti-JEPA证明了从术后语音中解码音素信号的能力,表明其作为语音科学可…

  5. TOOL · CL_231424 ·

    新 ViTAMINS 方法通过合成负样本增强视觉 Transformer 训练

    研究人员开发了 ViTAMINS,一种通过引入合成难负样本来训练自监督视觉 Transformer 的新方法。该方法提高了表示质量,在 ImageNet 等基准测试以及图像检索和分割等各种下游任务上取得了显著改进。该方法展示了涌现的分类能力,性能优于现有基线,甚至超过了像 V-JEPA with ViT-L 这样的大型模型。与对比学习中的生成方法和自蒸馏方法相比,ViTAMINS 提供了一种更具资源效率且功能更强大的替代方案。

  6. RESEARCH · CL_219027 ·

    发布新的视频预训练方法和千万小时级数据集

    研究人员推出了一种新颖的视频预训练方法 LeVJEPA,该方法在保持或提高下游准确性的同时,显著降低了计算成本。该方法绕过了常见的启发式方法,如架构不对称和 EMA 目标编码器,而是使用单个编码器配合不变性损失和 SIGReg 正则化。同时,LAION-BVD 数据集已发布,提供千万小时的视频数据用于多模态预训练,这些数据源自通过 CommonCrawl 收集的 8000 万个视频。该数据集旨在通过提供大规模、开放访问的合成字幕资源来…

  7. RESEARCH · CL_215980 ·

    新的自动驾驶模型预测未来世界状态和动作 · 已追踪 2 个来源

    研究人员开发了新的自动驾驶模型,专注于预测未来的世界状态和动作。WA-JEPA 模型(在一篇论文中提出)通过使用混合未来掩码预训练和条件流匹配来进行潜在未来预测,从而改进了视频联合嵌入预测架构(V-JEPA),并在 NAVSIM 和 HUGSIM 基准测试中取得了优异成绩。另一个模型 GeoWAM 强调使用点云等几何表示而非基于像素的方法,认为几何形状更能自然地捕捉驾驶动态并与动作执行保持一致,在开放循环和闭环评估中均表现出卓越的性能。

  8. TOOL · CL_210513 ·

    Gemini 2.5-Flash 在真实人机交互关系估计研究中领先

    一篇新的 arXiv 论文探讨了真实人机交互(HRI)场景下的多模态关系估计,超越了受控的实验室环境。研究人员发现,零样本大型语言模型(LLMs)表现良好,其中 Gemini 2.5-Flash 显示出特别的优势。一种结合 Gemini 的文本能力与音频(HuBERT)和视觉(V-JEPA)模型的融合模型取得了最佳的整体性能,这表明在动态的真实场景中,准确的关系估计需要多种模态的结合。

  9. TOOL · CL_208632 ·

    新V-JEPA4A模型增强自动驾驶视频分析能力

    研究人员开发了V-JEPA4A,这是一种专为自动驾驶应用设计的新型自监督学习模型。该模型采用了一种新颖的显著性驱动掩码策略,优先处理驾驶视频中在语义和时间上相关的信息,这与之前使用随机掩码的方法不同。在BDD100k MOT、Cityscapes和KITTI-2015等基准测试中,V-JEPA4A在目标跟踪和深度估计等任务上表现出显著的改进,同时仅略微增加了预训练时间。

  10. RESEARCH · CL_199767 ·

    新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性

    研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。

  11. TOOL · CL_180775 ·

    JEPA模型因领域转移而在新颖驾驶数据检测方面失败

    一篇新研究论文《Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data》发表在arXiv上,该论文强调了使用自监督学习模型(特别是联合嵌入预测架构JEPA)进行自动驾驶数据分析的一个关键缺陷。研究表明,虽然JEPA模型在在一个数据集上训练并在另一个数据集上测试时,似乎能有效地识别罕见的驾驶事件,但这种成功仅仅是领域转移的结果,而非真正的 the …

  12. TOOL · CL_143760 ·

    深度学习框架从视频中估算海岸波浪参数

    研究人员开发了一种新颖的深度学习框架,用于从单目视频中估算五个关键的海岸波浪参数。该系统利用V-JEPA骨干网络在具有挑战性的视觉条件下提取特征,采用双流SlowFast时间编码器,并基于Farneback算法的光流流。尽管在只有六个带注释的训练场景的数据受限环境下运行,该框架在诸如有效波高和波浪方向等参数上显示出统计学上显著的时间相关性,表明其可行性以及在更大数据集下改进的潜力。

  13. RESEARCH · CL_139052 ·

    密歇根大学发布 NeuroVFM 用于神经影像分析

    密歇根大学的研究人员开发了 NeuroVFM,一个新颖的神经影像基础模型。该模型使用 Vol-JEPA 方法,在超过 5.24 百万份临床 MRI 和 CT 扫描上进行训练,NeuroVFM 从未经整理的医学数据中学习,无需放射报告标签。这种自监督方法在众多诊断任务中取得了高性能,并展示了在医学影像分析中生成报告、患者分诊和跨模态迁移等应用的潜力。

  14. RESEARCH · CL_135143 ·

    新的JEPA风格模型学习有用的网络指纹嵌入

    研究人员开发了JA4-JEPA,这是一种基于Transformer的模型,将JEPA风格的预测学习应用于网络指纹。这种通过匹配潜在预测而非重新生成输入来学习的方法,在JA4DB和CIC-IDS-2017的JA4派生数据上进行了测试。该模型在保留数据集上达到了0.9899的高余弦相似度和0.9220的kNN准确率,表明其在从网络指纹生成有用嵌入方面的有效性。

  15. TOOL · CL_133548 ·

    AI框架提升交通系统碰撞预测能力

    研究人员开发了一种新颖的时空语义V2X框架,旨在改进智能交通系统中的碰撞预测。该框架利用视频联合嵌入预测架构(V-JEPA)生成未来交通场景的语义嵌入,然后通过V2X链路传输给车辆。通过仅发送这些语义嵌入而非原始视频数据,该系统显著降低了通信开销,同时提高了预测精度。实验表明,碰撞预测的F1分数提高了10%,传输需求减少了四个数量级。

  16. TOOL · CL_133441 ·

    AI需要世界模型来处理真实世界任务,JEPA在超越LLM方面展现出潜力

    世界模型领域的领军研究者Pascale Fung在ICML 2026上发表演讲,阐述了世界模型对于在真实世界中运行的AI代理的必要性。她认为,尽管大型语言模型(LLMs)和视觉语言模型(VLMs)可以处理文本和视觉数据,但它们缺乏物理环境所需的因果推理和预测能力。Fung强调了联合嵌入预测架构(JEPA)相对于生成式世界模型的优势,包括更少的参数量、更快的推理速度以及对噪声和环境变化的更强鲁棒性。她的团队的工作,包括V-JEPA和VL…

  17. RESEARCH · CL_128375 ·

    SiamJEPA 使用 Siamese 编码器改进自监督学习

    研究人员引入了 SiamJEPA,这是一种新颖的自监督表示学习方法,它在联合嵌入预测架构 (JEPA) 中使用了 Siamese 学生编码器。与之前使用单个编码器的 JEPA 模型不同,SiamJEPA 采用了 Siamese 编码器,其灵感来源于基于大脑的学习框架。在 ImageNet 上的实验表明,这种 Siamese 架构可以作为一种正则化器,提高表示的可分离性并加速早期训练阶段。在有限的训练预算下,SiamJEPA 的性能也优…

  18. TOOL · CL_123363 ·

    Drive-JEPA框架通过新颖的视频预训练推动端到端自动驾驶发展

    研究人员推出Drive-JEPA,一个结合视频联合嵌入预测架构(V-JEPA)和多模态轨迹蒸馏的端到端自动驾驶新框架。该方法将V-JEPA应用于海量驾驶视频的ViT编码器预训练,生成对轨迹规划至关重要的预测表示。该系统还包含一个以提案为中心的规划器,它蒸馏各种模拟器生成和人类轨迹,并使用动量感知选择机制来确保稳定和安全的驾驶行为。在NAVSIM基准测试中,Drive-JEPA取得了新的最先进成果。

  19. TOOL · CL_111799 ·

    新框架从视频中学习隐式3D物理

    研究人员开发了一个名为Neural Voxel Dynamics的自监督框架,可以直接从视频中学习隐式3D物理。该方法通过在3D体素潜在空间(Volumetric Latent Space)而非2D图像空间中进行预测,解决了当前生成视频模型的局限性。通过反投影语义特征并利用单目深度先验,该模型学习了一个条件于动作的转移算子,该算子在不依赖显式经典模拟器的情况下隐式地模拟物理现象。

  20. RESEARCH · CL_110621 ·

    中国AI初创公司Fysics AI推出基于物理学的世界模型

    总部位于上海的Fysics AI公司推出了Fysiverse,这是一个新的人工智能世界模型,将真实的物理定律直接融入其代码中。这种方法不同于OpenAI和Meta等公司使用的数据驱动方法。Fysics AI声称,通过遵循基本的物理学原理,Fysiverse可以克服当前世界模型中的常见问题,如物理幻觉和推理失败。