Mixture-of-Transformers
PulseAugur coverage of Mixture-of-Transformers — every cluster mentioning Mixture-of-Transformers across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新框架利用生成来提升MLLM的视觉理解能力
研究人员推出了一种名为GAS的新型训练框架,该框架利用生成作为辅助监督来增强多模态大语言模型(MLLM)的视觉理解能力。该方法在解耦的Transformer混合架构中应用了下一嵌入预测(NEP),允许生成损失来优化共享的视觉通路,而不会影响上层的理解模块。该框架旨在在训练后无需额外推理成本的情况下提高感知和空间理解能力。
-
Flex-π 模型将 3D 几何和对象语义与 RGB 数据集成
研究人员开发了 Flex-$\pi$,一个拥有 60 亿参数的世界动作模型,该模型将 3D 几何和对象语义与 RGB 数据集成在一起。该模型利用预训练的视频生成 VAE,无需额外训练即可编码 3D 点图,从而实现统一的潜在空间。Flex-$\pi$ 使用了具有跨模态强制的 Transformer 混合骨干网络,使其能够高效地处理输入流的各种子集。该模型在真实世界双臂操作任务的演示效率和泛化能力方面表现出显著的改进,优于现有基线。
-
新的GAS框架以零推理开销增强了MLLM的视觉理解能力
研究人员开发了一个名为GAS的新框架,该框架使用生成作为辅助监督方法来增强多模态大型语言模型(MLLM)的视觉理解能力。GAS在解耦的Transformer混合(MoT)架构中采用了下一嵌入预测(NEP)。这种方法允许生成任务在不增加训练后任何推理开销的情况下,用更精细的空间细节和更强的视觉保留来丰富视觉通路,从而提高感知和空间理解能力。
-
StatePlay模型通过预测内部状态来生成机械一致的游戏世界
研究人员推出了StatePlay,这是一种新颖的游戏世界模型,旨在生成视觉上逼真且机械上一致的游戏环境。与以往只关注像素级真实感的模型不同,StatePlay同时预测视觉内容和内部游戏状态,例如生命值和计时器。这种状态感知的做法确保了生成的游戏玩法符合游戏的明确规则和机制,与没有显式状态建模的模型相比,机械保真度提高了18.6%。该模型利用了混合Transformer架构来有效地整合视觉和状态表示。
-
NVIDIA 发布 Cosmos 3 Edge,一款用于机器人的 40 亿参数设备端 AI 模型
NVIDIA 发布了 Cosmos 3 Edge,这是一款专为机器人和视觉 AI 在设备上运行而设计的 40 亿参数开放世界模型。该模型使机器人和 AI 代理能够理解其环境、实时推理并在本地生成动作,从而解决了内存受限的边缘系统对数据中心级性能的需求。Cosmos 3 Edge 采用具有两个塔的 Transformer 混合架构来处理各种模态,并将世界建模直接连接到机器人策略训练和评估。
-
新模型RxBrain和GTA-VLA推动具身AI推理发展
研究人员推出了RxBrain,一个新颖的具身认知基础模型,它整合了语言和视觉推理能力以进行规划。与专注于场景理解或未来状态预测的现有模型不同,RxBrain将具身计划表示为一个统一的序列,利用语言来提供抽象结构,并利用视觉想象来 grounding 在物理状态中。该模型采用了Transformer混合架构,即使在没有大量动作数据预训练的情况下,在连续机器人动作生成方面也表现出有希望的性能。此外,还提出了一个名为GTA-VLA的新框架,…
-
GigaWorld-Policy-0.5通过更快的推理能力增强机器人控制
研究人员开发了GigaWorld-Policy-0.5,这是一种增强型世界动作模型(WAM),旨在实现更高效的机器人控制。该模型通过在训练时使用未来的视觉动力学,并在推理时采用仅动作解码方法,解决了传统WAM的计算开销问题。GigaWorld-Policy-0.5通过混合Transformer架构和用于优化训练配置的AutoResearch管道,在RTX 4090设置上实现了85毫秒的推理延迟。
-
NVIDIA Cosmos 3 World Models:发布 Colab 友好型迷你版教程
本教程演示了如何使用 cosmos-framework 实现 NVIDIA Cosmos 3 world models 的迷你版本,特别针对 Google Colab 的硬件限制进行了优化。它指导用户检查 Colab 环境的 GPU、内存和磁盘空间,以了解为什么无法进行完整的 Cosmos 3 推理。然后,教程将重点介绍如何使用合成数据构建和训练一个紧凑型的 omnimodal Mixture-of-Transformers 模型,该…
-
新AI模型推动触觉理解和视觉-触觉操作
研究人员开发了UniTac,这是一种新颖的统一多模态模型,专为跨不同传感器的触觉理解和生成而设计。该模型通过双层表示来捕捉传感器与物体之间的物理交互,使其能够执行物体属性描述和传感器识别等任务。此外,另一项研究引入了一种视觉-触觉策略,该策略利用光学触觉传感器产生的瞬时和累积运动之间的相关性来更好地区分细粒度接触状态。该方法旨在通过有效融合视觉和触觉数据来改进接触式操作。
-
Mural通过Transformer混合模型将冻结的LLM集成到图像生成中
研究人员开发了一种名为Mural的新方法,该方法将冻结的大型语言模型(LLM)与基于扩散的图像生成器集成。该方法利用Transformer混合模型(MoT)架构,在无需多模态训练数据或显式推理监督的情况下,将LLM知识迁移到文本到图像合成中。实验表明,Mural在GenEval和DPG-Bench等基准测试中取得了强劲的性能,并显著展现了跨语言图像生成和表情符号引导场景构建等新兴能力。
-
Symbiotic-MoE框架通过融合生成与理解能力,增强多模态AI
研究人员开发了Symbiotic-MoE,一个旨在通过使大型多模态模型(LMMs)在不发生灾难性遗忘的情况下同时执行图像生成和理解任务来改进LMMs的新预训练框架。该框架利用了具有零参数开销的原生多模态专家混合(MoE)Transformer架构。关键创新包括模态感知专家解耦(Modality-Aware Expert Disentanglement),它将专家划分为特定任务使用,同时保持语义桥梁;以及渐进式训练策略(Progress…
-
机器人研究在动作和场景生成方面推进世界模型 · 跟踪7个来源
一篇新的教程论文阐述了机器人学中“世界模型”的范围,将其分为观测空间和状态空间两类,并引入了将预测与机器人动作联系起来的“世界动作模型”。同时,一篇研究论文介绍了一种新颖的移动操作世界动作模型ABot-M0.5,该模型采用Transformer混合架构和梦境强制训练策略,取得了最先进的性能。另一个项目Micro-World提供了一个动作控制的交互式世界模型,用于生成开放域场景,并发布了模型权重和代码以促进社区研究。
-
新框架通过保留知识和改进生成来增强多模态AI
研究人员正在开发新框架以增强多模态AI模型。Rosetta 引入了一种可组合的预训练方法,可以在不破坏现有知识的情况下添加新模态并保留核心知识,使用动量锚定正交投影来管理梯度冲突。COMPASS 在统一系统中将组合意图控制进行接地,通过使用共享的专家令牌来同时改进感知和生成。SRUM 使统一的多模态模型能够通过使用其理解模块作为内部评估器来改进其生成能力,采用双重奖励系统来保证全局和局部保真度。此外,ReVisIT 提供了一种无需训练…
-
Vera 分层扩散模型通过内容保留增强视频编辑
研究人员推出了一种新颖的分层扩散框架 Vera,用于内容保留视频编辑。与重新生成整个视频的现有方法不同,Vera 专注于生成一个编辑层和一个 alpha 蒙版,然后将它们与原始视频合成。这种方法将创意编辑过程与保留未更改元素(如角色和背景)分离开来。该框架采用了 Transformer 混合架构,通过为每个层使用单独的 DiT 并通过联合自注意力进行通信来扩展文本到视频的 Diffusion Transformer (DiT)。Ver…
-
新AI框架通过内容保留和实时能力增强视频编辑
研究人员开发了新的视频编辑框架,解决了当前自动化系统的局限性。VideoAgent利用多智能体编排框架,为多样化的视频理解和编辑任务提供了一体化解决方案,并以更低的成本实现了高成功率。Vera是一个分层扩散模型,通过生成单独的编辑层和Alpha蒙版来专注于内容保留,在这方面优于现有模型。LiveEdit通过采用蒸馏管道和面向AR的蒙版缓存,解决了实时流视频编辑问题,能够实现快速、稳定、高保真的编辑,适用于交互式应用。
-
新的AI模型应对自动驾驶的远期规划问题
研究人员正在开发先进的自动驾驶AI模型,重点是改进轨迹规划和远期决策。包括ParkingTransformer、TerraTransfer、AlignDrive、Metis和GraphWorld在内的几个新框架,利用了LLM、自我博弈和基于图的世界建模等技术,以增强复杂驾驶场景下的泛化性、效率和安全性。这些方法旨在通过更好地整合感知、预测和规划,以及从多样化数据中学习而不完全依赖专家演示,来克服现有方法的局限性。
-
MaskWAM模型统一掩码以增强机器人控制
研究人员开发了MaskWAM,这是一种新颖的以物体为中心的世界-动作模型,旨在通过视频预测来改进机器人控制。通过使用Transformer混合模型将掩码整合为输入和预测,MaskWAM解决了当前模型中的空间瓶颈,减少了歧义和背景偏差。这种方法增强了语义监督,并提供了精确的空间锚定,从而在各种机器人任务上取得了显著的性能提升,包括那些具有模糊语言指令的任务。
-
Intel 和 NVIDIA 在 AI 硬件和模型方面取得进展
Intel 专注于代理式 AI 以推动 CPU 复兴,并旨在建立一个全栈式 AI 计算平台。与此同时,NVIDIA 推出了 Cosmos 3,一个基于 Mixture-of-Transformers 架构的开放式物理 AI 模型。这些进展凸显了 AI 在硬件和模型开发中的日益融合。
-
NVIDIA 发布 Cosmos 3 全模态模型和 Nemotron 3 LLM
NVIDIA 发布了 Cosmos 3,一个采用 Transformer 混合架构的全模态世界模型,整合了语言、图像、视频、音频和动作。此次发布包含开放权重、代码和数据集,经过微调的版本在图像和视频生成基准测试中取得了最先进的成果。此外,NVIDIA 还推出了 Nemotron 3 Ultra,一个高效的 550B 开放权重 LLM,并预览了用于个人电脑的 RTX Spark 超级芯片。
-
X Square Robot 发布具有开放代码和真实机器人测试的 4B VLA 模型
X Square Robot 发布了 Wall-OSS-0.5,一个拥有 40 亿参数的视觉-语言-动作 (VLA) 模型。该模型构建在 30 亿参数的视觉-语言模型骨干之上,并使用 Transformer 混合架构整合了动作专家。值得注意的是,该研究在微调前对模型在真实机器人上的性能进行了评估,展示了强大的零样本能力以及在任务特定适应后的显著改进。