SIGReg
PulseAugur coverage of SIGReg — every cluster mentioning SIGReg across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Vision Transformer 编码器可动态增长以匹配任务复杂度
研究人员推出了一种名为 Successive Capacity Growth (SCG) 的新方法,用于扩展联合嵌入预测架构 (JEPA) 中的 Vision Transformer 编码器以进行世界建模。SCG 从最小的编码器开始,并根据任务复杂度通过测试和验证机制增量地增加其宽度或深度。该方法旨在优化编码器大小,避免在简单任务上过度配置,在复杂任务上配置不足。草图各向同性高斯正则化器 (SIGReg) 用于在扩展过程中保持学习维度…
-
发布新的视频预训练方法和千万小时级数据集
研究人员推出了一种新颖的视频预训练方法 LeVJEPA,该方法在保持或提高下游准确性的同时,显著降低了计算成本。该方法绕过了常见的启发式方法,如架构不对称和 EMA 目标编码器,而是使用单个编码器配合不变性损失和 SIGReg 正则化。同时,LAION-BVD 数据集已发布,提供千万小时的视频数据用于多模态预训练,这些数据源自通过 CommonCrawl 收集的 8000 万个视频。该数据集旨在通过提供大规模、开放访问的合成字幕资源来…
-
新的JEPA方法使用对比逆动力学来改进世界模型
研究人员开发了一种名为动作对比掩码转换模型(AC-MTM)的新方法,用于联合嵌入预测架构(JEPAs),以解决世界模型中的平凡解问题。与使用SIGReg等正则化器强制执行特定潜在分布的先前方法不同,AC-MTM使用对比逆动力学来防止崩溃。该方法训练一个逆动力学头来识别产生给定潜在转换的动作,从而在不需要预定义目标分布的情况下稳定表示。AC-MTM在更简单的任务上与现有方法相当,并在复杂的OGBench视觉场景任务上显著优于SIGReg…
-
新的SCALE方法通过改进潜在空间几何结构来增强AI规划能力
研究人员开发了一种新方法SCALE(State-Calibrated Latent Embeddings),用于改进联合嵌入预测世界模型中的规划。SCALE通过将成对潜在距离与标准化状态空间距离相关联,来增强潜在表征的几何特性,类似于DINO-WM中发现的特性。这种方法在训练过程中作为一种轻量级正则化器应用,与LeWorldModel等现有方法相比,在各种任务、规划求解器和计算预算上都显示出了一致的改进。研究结果表明,潜在空间的几何结…
-
新的SIGReg方法提升了多任务世界模型学习能力
研究人员开发了一种名为Temporally Centered SIGReg的新方法,以改进世界模型中的多任务学习。原始的SIGReg技术虽然对单任务有效,但在处理多任务时会压缩潜在表示并导致混叠,从而遇到困难。新方法将SIGReg应用于时间上居中的残差,避免了对聚类分离的直接压力,并允许更灵活的潜在结构。该方法在LIBERO基准测试中显著提高了下游成功率,优于现有方法,并接近大规模预训练基线。
-
Temporal-Distance JEPA 增强世界模型预测控制
研究人员推出了一种新颖的潜在世界模型预测控制表示学习方法——Temporal-Distance JEPA (TD-JEPA)。该方法通过从无奖励轨迹中挖掘定向时间成本来增强联合嵌入预测架构 (JEPAs),提高了根据目标进展对想象的未来进行排名的能力。TD-JEPA 在 Two-Room 和 OGB-Cube 等环境中展示了显著的性能提升,通过有效弥合训练和规划之间的差距,超越了先前的方法。
-
新的JEPA世界模型通过深度先验提高了机器人数据的迁移性
研究人员开发了一种新的世界模型训练方法,特别是基于联合嵌入预测架构(JEPA)的模型,以提高它们从复杂真实世界机器人数据中学习的能力。通过在训练过程中将深度作为几何先验,并结合SIGReg正则化器(该正则化器在根据场景几何组织潜在表示的同时促进潜在多样性),模型实现了更具迁移性的表征。一个使用此方法训练的1800万参数模型在TartanGround等基准测试中,视觉里程计探测误差降低了33%,并且显著提高了惊奇检测和回滚保真度,甚至在…
-
新的训练方法通过潜在想象增强机器人导航能力
研究人员开发了一种新的训练方法,用于训练腿式机器人的导航策略,该方法增强了它们预测和响应动态环境的能力。通过在训练期间引入轻量级的预测监督机制,机器人的循环状态学会预测未来障碍物的移动。这种预测信号在推理时会被丢弃,但能显著提高导航成功率并减少碰撞,而不会增加计算开销。该方法已在 Unitree Go2 机器人上成功实现了零样本模拟到现实的迁移,使其无需微调即可在复杂的室内外场景中导航。
-
新技术旨在提高LLM KV缓存效率和准确性
研究人员正在探索新颖的方法来优化大型语言模型的KV缓存,以提高其效率。KV缓存是推理的关键组件,但以其高内存和带宽需求而闻名。一种称为局部分布恢复的方法,旨在通过专注于恢复logits的局部分布来减轻低比特KV缓存量化引起的准确性下降。另一项研究调查了训练时正则化技术(特别是SIGReg)是否可以重塑模型表示以更好地支持KV缓存量化,发现直接KV正则化在某些量化方案下是有益的,但其优势会随着更先进的方法而减弱。
-
AV-JEPA 模型推进视听自监督学习
研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSound 和 AudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。
-
新理论将JEPA世界模型与SIGReg目标下的主动推理联系起来
一篇新的理论论文提出,当SIGReg目标用作联合嵌入预测架构(JEPA)中的反崩溃正则化器时,它可以作为主动推理(AIF)的有效变分自由能。该研究将四种非对比正则化器(VICReg、LogDet、PairDist和SIGReg)归类到熵估计器层次结构中,展示了SIGReg如何消除先验失校差距。这使得JEPA目标成为一个精确的信息瓶颈和AIF实用价值的代理,而其他正则化器则留下不可约项。
-
新型Kepler-Encoder-v0.1模型融合机器人状态与视觉信息
研究人员开发了Kepler-Encoder-v0.1,这是一种专为机器人设计的新型多模态嵌入模型。该模型将视觉数据与本体感觉以及力/扭矩传感器信息整合到一个统一的潜在空间中。该方法旨在提高机器人对其自身状态的理解,特别是在视觉受限的领域,例如检测力和接触。
-
新研究表明局部突触规则可实现无反向传播的自监督学习
研究人员证明,局部突触学习规则,特别是尖峰时间依赖可塑性(STDP+)和稳态可塑性,可以有效地实现用于自监督学习的SIGReg梯度。该方法绕过了对传统反向传播、全局误差信号或标签信息的需要,仅依赖于局部放电统计和感官输入的时序连续性。该方法在合成聚类任务上显示出有希望的结果,并在按时间顺序排列的MNIST数据上达到了87.3%的线性探测准确率,表明其具有端到端功能的潜力。
-
LeNEPA:新的时间序列自监督学习方法减少对数据增强的依赖
研究人员推出了一种新颖的时间序列数据自监督学习方法LeNEPA,该方法不需要数据增强。LeNEPA利用因果骨干网络和下一个潜在标记预测目标,采用基于SIGReg的各向同性正则化以及用于损失计算的轻量级投影空间。在ECG数据和合成诊断语料库上的实验表明,LeNEPA能够更快地获得表示,并且即使在跨不同数据集重用其方法而不进行调整的情况下,也能保持有用的性能增益,在某些场景下优于类似的固定JEPA方法。
-
新的统计正则化器增强了自监督学习的稳定性
研究人员推出了一系列新的自监督学习(SSL)统计正则化器,旨在提高表示坍塌的预防能力。所提出的方法在分析上将随机投影整合到球面上,为最大均值差异(MMD)、核斯泰因差异(KSD)和库尔巴克-莱布勒(KL)散度直接在球面上提供了确定性目标。与现有的随机切片正则化器相比,这些技术提供了更稳定的优化和更快的收敛速度,在ImageNet和Galaxy10等数据集上显示出了一致的改进。
-
Yann LeCun 开发高效 AI 模型,可在单个 GPU 上训练
Yann LeCun 正在开发一种新颖的 AI 模型架构,旨在实现极高的效率。该新模型仅拥有 1500 万个参数,可在几小时内在单个 GPU 上进行训练。该方法包含两个关键概念:用于学习紧凑世界模型的联合嵌入预测架构 (JEPA) 和用于稳定且可扩展的潜在空间训练的草图各向同性高斯正则化器 (SIGReg)。
-
VISReg 通过新的正则化技术增强自监督学习
研究人员推出了一种新颖的计算机视觉自监督学习正则化技术VISReg。该方法通过结合方差控制和基于切片 Wasserstein 的草图目标来增强训练稳定性,后者强制执行嵌入的完整分布形状。VISReg 表现出强大的性能,在低质量和分布外数据集上优于现有方法,并且与其他人相比,使用的数据量显著减少,取得了具有竞争力的结果。
-
HamJEPA通过哈密顿几何和辛预测推进JEPAs
研究人员推出了一种新颖的联合嵌入预测架构(JEPAs)方法HamJEPA,该方法超越了各向同性正则化。这种新方法将视图编码为相空间状态,并使用学习到的哈密顿跳蛙图进行跨视图预测。在CIFAR-100和ImageNet-100上的实验表明,与SIGReg等现有方法相比,kNN和线性探针精度有了显著提高。
-
研究人员探索自监督学习的几何和信息论框架
研究人员基于信息瓶颈原理,开发了一个新的编码器-解码器学习的几何和信息论框架。该框架将问题重塑为率失真任务,表明在任何失真水平下,最优表示都涉及预测流形的软聚类。该研究引入了草图各向同性高斯正则化(SIGReg)作为一种有原则的分布正则化器,用于有限或无监督学习,并在玩具问题和FashionMNIST上进行了实验验证。