PulseAugur
实时 16:41:04
实体 V-JEPA

V-JEPA

PulseAugur coverage of V-JEPA — every cluster mentioning V-JEPA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 19 条
  1. TOOL · CL_215980 ·

    新WA-JEPA模型推动自动驾驶规划发展

    研究人员开发了WA-JEPA,一种用于自动驾驶规划的新型世界-动作模型,它改进了视频联合嵌入预测架构(V-JEPA)范式。与之前使用随机掩码和确定性回归的V-JEPA模型不同,WA-JEPA采用了混合未来掩码预训练和条件流匹配,以实现更有效的未来预测。这种方法允许联合未来-动作预测,直接塑造与规划相关的世界表征,并在NAVSIM和HUGSIM等基准测试中取得了最先进的成果。

  2. TOOL · CL_210513 ·

    Gemini 2.5-Flash 在真实人机交互关系估计研究中领先

    一篇新的 arXiv 论文探讨了真实人机交互(HRI)场景下的多模态关系估计,超越了受控的实验室环境。研究人员发现,零样本大型语言模型(LLMs)表现良好,其中 Gemini 2.5-Flash 显示出特别的优势。一种结合 Gemini 的文本能力与音频(HuBERT)和视觉(V-JEPA)模型的融合模型取得了最佳的整体性能,这表明在动态的真实场景中,准确的关系估计需要多种模态的结合。

  3. TOOL · CL_208632 ·

    新V-JEPA4A模型增强自动驾驶视频分析能力

    研究人员开发了V-JEPA4A,这是一种专为自动驾驶应用设计的新型自监督学习模型。该模型采用了一种新颖的显著性驱动掩码策略,优先处理驾驶视频中在语义和时间上相关的信息,这与之前使用随机掩码的方法不同。在BDD100k MOT、Cityscapes和KITTI-2015等基准测试中,V-JEPA4A在目标跟踪和深度估计等任务上表现出显著的改进,同时仅略微增加了预训练时间。

  4. RESEARCH · CL_199767 ·

    新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性

    研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。

  5. TOOL · CL_180775 ·

    JEPA模型因领域转移而在新颖驾驶数据检测方面失败

    一篇新研究论文《Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data》发表在arXiv上,该论文强调了使用自监督学习模型(特别是联合嵌入预测架构JEPA)进行自动驾驶数据分析的一个关键缺陷。研究表明,虽然JEPA模型在在一个数据集上训练并在另一个数据集上测试时,似乎能有效地识别罕见的驾驶事件,但这种成功仅仅是领域转移的结果,而非真正的 the …

  6. TOOL · CL_143760 ·

    深度学习框架从视频中估算海岸波浪参数

    研究人员开发了一种新颖的深度学习框架,用于从单目视频中估算五个关键的海岸波浪参数。该系统利用V-JEPA骨干网络在具有挑战性的视觉条件下提取特征,采用双流SlowFast时间编码器,并基于Farneback算法的光流流。尽管在只有六个带注释的训练场景的数据受限环境下运行,该框架在诸如有效波高和波浪方向等参数上显示出统计学上显著的时间相关性,表明其可行性以及在更大数据集下改进的潜力。

  7. RESEARCH · CL_139052 ·

    密歇根大学发布 NeuroVFM 用于神经影像分析

    密歇根大学的研究人员开发了 NeuroVFM,一个新颖的神经影像基础模型。该模型使用 Vol-JEPA 方法,在超过 5.24 百万份临床 MRI 和 CT 扫描上进行训练,NeuroVFM 从未经整理的医学数据中学习,无需放射报告标签。这种自监督方法在众多诊断任务中取得了高性能,并展示了在医学影像分析中生成报告、患者分诊和跨模态迁移等应用的潜力。

  8. RESEARCH · CL_135143 ·

    新的JEPA风格模型学习有用的网络指纹嵌入

    研究人员开发了JA4-JEPA,这是一种基于Transformer的模型,将JEPA风格的预测学习应用于网络指纹。这种通过匹配潜在预测而非重新生成输入来学习的方法,在JA4DB和CIC-IDS-2017的JA4派生数据上进行了测试。该模型在保留数据集上达到了0.9899的高余弦相似度和0.9220的kNN准确率,表明其在从网络指纹生成有用嵌入方面的有效性。

  9. TOOL · CL_133548 ·

    AI框架提升交通系统碰撞预测能力

    研究人员开发了一种新颖的时空语义V2X框架,旨在改进智能交通系统中的碰撞预测。该框架利用视频联合嵌入预测架构(V-JEPA)生成未来交通场景的语义嵌入,然后通过V2X链路传输给车辆。通过仅发送这些语义嵌入而非原始视频数据,该系统显著降低了通信开销,同时提高了预测精度。实验表明,碰撞预测的F1分数提高了10%,传输需求减少了四个数量级。

  10. TOOL · CL_133441 ·

    AI需要世界模型来处理真实世界任务,JEPA在超越LLM方面展现出潜力

    世界模型领域的领军研究者Pascale Fung在ICML 2026上发表演讲,阐述了世界模型对于在真实世界中运行的AI代理的必要性。她认为,尽管大型语言模型(LLMs)和视觉语言模型(VLMs)可以处理文本和视觉数据,但它们缺乏物理环境所需的因果推理和预测能力。Fung强调了联合嵌入预测架构(JEPA)相对于生成式世界模型的优势,包括更少的参数量、更快的推理速度以及对噪声和环境变化的更强鲁棒性。她的团队的工作,包括V-JEPA和VL…

  11. RESEARCH · CL_128375 ·

    SiamJEPA 使用 Siamese 编码器改进自监督学习

    研究人员引入了 SiamJEPA,这是一种新颖的自监督表示学习方法,它在联合嵌入预测架构 (JEPA) 中使用了 Siamese 学生编码器。与之前使用单个编码器的 JEPA 模型不同,SiamJEPA 采用了 Siamese 编码器,其灵感来源于基于大脑的学习框架。在 ImageNet 上的实验表明,这种 Siamese 架构可以作为一种正则化器,提高表示的可分离性并加速早期训练阶段。在有限的训练预算下,SiamJEPA 的性能也优…

  12. TOOL · CL_123363 ·

    Drive-JEPA框架通过新颖的视频预训练推动端到端自动驾驶发展

    研究人员推出Drive-JEPA,一个结合视频联合嵌入预测架构(V-JEPA)和多模态轨迹蒸馏的端到端自动驾驶新框架。该方法将V-JEPA应用于海量驾驶视频的ViT编码器预训练,生成对轨迹规划至关重要的预测表示。该系统还包含一个以提案为中心的规划器,它蒸馏各种模拟器生成和人类轨迹,并使用动量感知选择机制来确保稳定和安全的驾驶行为。在NAVSIM基准测试中,Drive-JEPA取得了新的最先进成果。

  13. TOOL · CL_111799 ·

    新框架从视频中学习隐式3D物理

    研究人员开发了一个名为Neural Voxel Dynamics的自监督框架,可以直接从视频中学习隐式3D物理。该方法通过在3D体素潜在空间(Volumetric Latent Space)而非2D图像空间中进行预测,解决了当前生成视频模型的局限性。通过反投影语义特征并利用单目深度先验,该模型学习了一个条件于动作的转移算子,该算子在不依赖显式经典模拟器的情况下隐式地模拟物理现象。

  14. RESEARCH · CL_110621 ·

    中国AI初创公司Fysics AI推出基于物理学的世界模型

    总部位于上海的Fysics AI公司推出了Fysiverse,这是一个新的人工智能世界模型,将真实的物理定律直接融入其代码中。这种方法不同于OpenAI和Meta等公司使用的数据驱动方法。Fysics AI声称,通过遵循基本的物理学原理,Fysiverse可以克服当前世界模型中的常见问题,如物理幻觉和推理失败。

  15. TOOL · CL_98085 ·

    新的Clin-JEPA框架支持电子健康记录数据的联合嵌入预测预训练

    研究人员开发了Clin-JEPA,一个新颖的多阶段协同训练框架,用于电子健康记录(EHR)的联合嵌入预测预训练。该框架解决了创建单一AI模型以同时预测患者轨迹和执行各种下游风险预测任务的挑战,而无需进行特定任务的微调。Clin-JEPA采用了一个为期五阶段的预训练课程,以稳定地协同训练一个Qwen3-8B编码器和一个潜在轨迹预测器,通过独特地融合潜在的滚动漂移并学习临床上可区分的潜在几何形状,在EHR数据上展示了改进的性能。

  16. RESEARCH · CL_79496 ·

    视频基础模型展现出涌现的直观物理学理解能力

    一篇新的研究论文探讨了视频基础模型是否具备对直观物理学的理解。该研究使用IntPhys2和Minimal Video Pairs等基准测试,探测了V-JEPA、VideoMAE和LTX-Video等模型的冻结表征。结果表明,V-JEPA表现最佳,尤其是在时间动态探测方面,而VideoMAE具有竞争力,LTX-Video则显示出较弱但存在的信号。研究还发现,物理学知识在这些模型的中间到后期层中更容易被访问。

  17. RESEARCH · CL_68572 ·

    TrAction 使用稀疏轨迹实现高效动作识别

    研究人员开发了 TrAction,一种新颖的 Transformer 架构,用于使用稀疏点轨迹而非密集视频进行动作识别。该方法旨在减少依赖外观或背景线索的传统模型中存在的偏差。TrAction 在 Something-Something V2 和 EPIC-Kitchens-100 等基准测试中取得了有竞争力的准确率,并且与其他模型融合后,性能得到进一步提升。

  18. RESEARCH · CL_41767 ·

    VISTA 系统凭借物体交互预测能力赢得 Ego4D 挑战赛

    研究人员开发了 VISTA,一个用于预测第一人称视角视频中人类与物体交互的新型系统。VISTA 集成了空间物体检测和来自冻结的 V-JEPA 2.1 模型的时序上下文来预测未来的交互。该方法在 EgoVis 2026 年 Ego4D 短期物体交互预测挑战赛中获得第一名。

  19. SIGNIFICANT · CL_13044 ·

    卓驭转向实体AI,视之为生存的必然选择

    专注于智能汽车的公司卓驭正将其重心转向“实体AI”,副总裁驭贝贝将其描述为生存的必然选择,而非市场趋势。该公司已开发出一种原生的多模态基础模型,旨在直接理解物理世界,而非通过语言翻译。这一战略转变旨在使卓驭能够为未来与传统汽车技术供应商以及跨行业数字AI巨头的竞争做好准备,并探索超越硬件销售和开发费用的新商业模式。