Joint-Embedding Predictive Architectures
PulseAugur coverage of Joint-Embedding Predictive Architectures — every cluster mentioning Joint-Embedding Predictive Architectures across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Orthogonal JEPA 框架通过因子化状态增强潜在世界模型
研究人员推出了一种新颖的潜在世界建模框架 Orthogonal JEPA,旨在提高预测和推理能力。该方法通过将预测状态分解为正交分量,每个分量都有自己的预测路径,从而解决了标准联合嵌入预测架构 (JEPAs) 的局限性。这种方法旨在防止冗余容量分配,并为复杂系统提供更清晰的梯度。在视觉、健康记录和分子动力学等多个领域的实验证明了其在表示质量、预测和长时稳定性方面的有效性。
-
新的JEPA方法使用对比逆动力学来改进世界模型
研究人员开发了一种名为动作对比掩码转换模型(AC-MTM)的新方法,用于联合嵌入预测架构(JEPAs),以解决世界模型中的平凡解问题。与使用SIGReg等正则化器强制执行特定潜在分布的先前方法不同,AC-MTM使用对比逆动力学来防止崩溃。该方法训练一个逆动力学头来识别产生给定潜在转换的动作,从而在不需要预定义目标分布的情况下稳定表示。AC-MTM在更简单的任务上与现有方法相当,并在复杂的OGBench视觉场景任务上显著优于SIGReg…
-
新的诊断工具评估 AI 世界模型对视觉扰动的弹性
研究人员开发了一种名为动作条件预测一致性(ACPC)的新诊断工具,用于评估联合嵌入预测架构(JEPAs)中的世界模型。ACPC 衡量了在相同动作序列下,当世界模型接收到视觉扰动输入时,其预测与接收到干净输入时的预测之间的差异。该指标被证明可以限制由视觉扰动引起的预测误差,并有助于评估不同状态在回滚后的可区分性。在各种视觉控制任务上的实验表明,ACPC 在预测预测和成本误差的变化方面非常有效,并且在不同类型的扰动下都具有诊断能力。
-
UniJEPA 统一图像和视频视觉世界建模
研究人员推出 UniJEPA,这是一种新颖的统一架构,用于自监督视觉世界建模。该新框架将图像级光度预测和视频级时间预测整合到一个单一的潜在空间中。UniJEPA 使用单一的端到端目标,简化了训练,并证明共享的潜在空间可以支持可控的抽象,以实现不变结构和等变动力学。
-
JEPA模型在处理语言的条件结构时面临挑战
一篇新论文探讨了将联合嵌入预测架构(JEPA)应用于语言处理所面临的挑战,将其在图像和音频领域的有效性与在文本领域的局限性进行了对比。研究强调,确定性的JEPA风格潜在预测在处理语言的条件结构时存在困难,因为语言可以有多种有效的补全方式,这与图像更具空间连续性的性质不同。I-JEPA和T-JEPA模型的实验表明,存在互信息饱和、训练-验证不稳定性以及下游迁移能力差等问题,这表明文本的JEPA目标必须能够容纳多种合理的补全,而不是将它们…
-
Temporal-Distance JEPA 增强世界模型预测控制
研究人员推出了一种新颖的潜在世界模型预测控制表示学习方法——Temporal-Distance JEPA (TD-JEPA)。该方法通过从无奖励轨迹中挖掘定向时间成本来增强联合嵌入预测架构 (JEPAs),提高了根据目标进展对想象的未来进行排名的能力。TD-JEPA 在 Two-Room 和 OGB-Cube 等环境中展示了显著的性能提升,通过有效弥合训练和规划之间的差距,超越了先前的方法。
-
新的正则化方法解决自监督学习中的偏见问题
研究人员推出了一种名为无偏开放世界正则化(UOWReg)的新型框架,旨在减轻自监督学习(SSL)和联合嵌入预测架构(JEPAs)中的偏见。与使用全局正则化的先前方法不同,UOWReg 侧重于条件分布匹配,确保学习到的表示与目标属性之间的统计独立性。该方法在 CelebA 等基准测试中有效减少了偏见违规行为,同时保持了具有竞争力的准确性。此外,UOWReg 在防止复杂场景(如新提出的合成雕刻任务)中的亚群崩溃方面显示出潜力,通过有效分离细微特征。
-
Yann LeCun 提出 JEPA 以增强 LLM 对物理世界的理解
Yann LeCun 在最近的一次采访中,讨论了当前大型语言模型 (LLM) 在真正理解物理世界方面的局限性,对比了它们回答问题的能力与执行需要物理理解的任务的能力。他提出了联合嵌入预测架构 (JEPA) 作为一种潜在的解决方案,以赋予 AI 对物理学和现实世界动态更好的掌握。此次讨论引发了关于 JEPA 是否代表了真正的架构进步,还是在人工智能发展中寻找一个难以捉摸的“万能药”的争论。
-
MorphologyFM模型从心电图和脉搏血氧波形中学习
研究人员开发了MorphologyFM,这是一种新颖的基础模型,旨在从心电图(ECG)和脉搏血氧饱和度(SpO2)波形中学习表示。与以往侧重于重建或预测的方法不同,MorphologyFM明确保留了这些生理信号在临床上具有重要意义的形态结构。该模型利用了形态感知自监督学习目标,结合了引导掩码、跨模态学习和对比潜在对齐。在心律失常和低血氧症预测等各种预测任务上的评估表明,MorphologyFM的性能优于现有的自监督学习技术,并证明了E…
-
Qantara JEPA模型支持从单一检查点进行多范式控制
研究人员推出了一种新颖的联合嵌入预测架构(JEPA)——Qantara,它允许单个模型检查点在推理时支持从原始像素进行控制的多种推理范式。与之前在训练期间承诺轨迹优化或行为克隆的JEPA模型不同,Qantara的联合训练目标在推理时提供了灵活性。这种多范式方法包括潜在规划、行为克隆和逆动力学,在OGBench-Cube和LeWM控制套件等基准测试中展示了最先进的性能。
-
Fast LeWorldModel 通过并行预测加速视觉规划
研究人员开发了 Fast LeWorldModel (Fast-LeWM),这是对现有联合嵌入预测架构 (JEPAs),如用于视觉规划的 LeWorldModel (LeWM) 的一项改进。与 LeWM 评估动作序列的计算密集型单步潜在转移模型不同,Fast-LeWM 采用并行动作前缀预测。这种新方法通过编码动作前缀并同时预测未来潜在状态来模拟多个视界上的累积动作效应。该方法显著减少了规划时间和潜在误差累积,从而提高了各种任务的成功率。
-
新的DCGWM架构可防止世界模型中的目标干扰崩溃
研究人员推出了一种新颖的双通道接地世界建模 (DCGWM) 架构,旨在防止联合嵌入预测架构 (JEPAs) 中的目标干扰崩溃 (OIC)。当从两种不同的数据类型(例如物理动力学和社会行为动力学)学习时,会发生 OIC,导致一个学习通道主导并降级另一个通道。DCGWM 通过使用具有内向梯度流的分区潜在空间来解决此问题,将物理和行为子空间分开。这种结构分离,结合特定的损失函数和隔离的生成渲染层,旨在为两个接地通道维护表征的完整性。
-
新的RePAIR架构通过自监督学习国际象棋概念
研究人员开发了一种名为RePAIR的新型自监督学习架构,它结合了MAE、JEPA和BERT的元素。该架构旨在将序列数据(如国际象棋局面)编码为有意义的表示。在国际象棋中的实验表明,RePAIR可以在没有强化学习的情况下学习概念并推理棋子移动,从而实现对棋局轨迹的直观分析。
-
新架构实现世界模型近乎无限的时间一致性
一篇新研究论文介绍了一个物理基础符号架构(PGSA),它克服了当前统计世界模型的局限性。与需要高斯动力学来实现线性可辨识性和时间一致性的现有模型不同,PGSA 可以在所有物理状态下实现精确的线性可辨识性。这种新架构还提供了近乎无限的时间一致性,这意味着即使对于非高斯系统,其误差也仅受数值精度限制。
-
新的AI模型推动3D医学影像自监督学习进展
两篇新研究论文探讨了用于3D医学影像的高级自监督学习技术。其中一篇论文介绍了一个使用掩码自编码器(MAE)和联合嵌入预测架构(JEPA)的框架,以提高脑部MRI的疾病检测能力,并强调了不同的自监督目标如何使具有特定解剖结构的任务受益。另一篇论文提出了一个可泛化的3D框架和一个名为3DINO-ViT的模型,该模型在一个大型多模态数据集上进行了预训练,在各种分割和分类任务中表现出色,并显示出对分布外数据的泛化能力。
-
新的JEPA架构实现从像素到端到端的稳定训练
研究人员开发了LeWorldModel (LeWM),一种新颖的联合嵌入预测架构 (JEPA),可以从原始像素稳定地进行端到端训练。与之前脆弱的JEPA方法不同,LeWM仅使用两个损失项,可以在数小时内使用单个GPU进行训练,其规划速度比基于基础模型的世界模型快48倍。随后的论文介绍了UR-JEPA,它通过目标统一可校正性来改进JEPA训练,与LeJEPA相比,显示出改进的种子稳定性和独特的几何表示。
-
新的 JEPA 模型通过修正分布匹配学习稀疏表示
研究人员开发了 Rectified LpJEPA,这是一种联合嵌入预测架构 (JEPA) 的新方法,旨在创建更有效和稀疏的表示。与之前通过正则化趋向高斯分布而偏爱密集表示的方法不同,Rectified LpJEPA 使用了修正分布匹配正则化 (RDMReg) 技术。该方法允许显式控制表示的稀疏性,同时保持下游任务的性能,在图像分类中展示了稀疏性和准确性之间的有利权衡。
-
Yann LeCun 驳斥 LLM 是通往 AGI 的道路,力挺 JEPA
Yann LeCun 认为,当前的大型语言模型(LLMs)由于缺乏预测后果或执行基于搜索的推理的能力,并非通往人类水平智能的道路。他提倡他的联合嵌入预测架构(JEPA)方法,该方法侧重于世界模型的自监督学习。JEPA 旨在通过预测缺失的数据嵌入来学习表征,他认为这种方法在实现通用智能方面更有前景。