PulseAugur
中
实时 04:59:01
实体 variational auto-encoder

variational auto-encoder

PulseAugur coverage of variational auto-encoder — every cluster mentioning variational auto-encoder across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
185
90 天内 185
发布 · 30天
0
90 天内 0
论文 · 30天
163
90 天内 163
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_285713 ·

    Mac 用户可以使用分阶段加载以更少的 RAM 运行 Qwen-Image-2.1

    一位用户开发了一个名为“stageload”的库,以优化 Qwen-Image-2.1 模型在内存有限的 Mac 上的内存使用。通过仅加载图像生成过程每个阶段所需的组件(文本编码器、Transformer、VAE),该库将峰值内存消耗从 43 GB 以上降低到约 19 GB,从而避免了系统交换和崩溃。这种分阶段加载方法保持了图像质量,并且与标准的即时加载方法相比,生成时间相当或略慢,同时还减少了初始模型加载时间。

  2. RESEARCH · CL_283400 ·

    新研究探讨稀疏自编码器的特征可解释性和层级结构

    两篇新研究论文探讨了稀疏自编码器(SAEs)的可解释性和结构。第一篇论文介绍了BeFOND,一个统一了SAEs推理和字典学习的模型,提高了在语言模型中检测稀有特征和识别概念的能力。第二篇论文提出了一个严格的评估协议,用于评估SAEs是否学习到了有意义的概念层级,发现虽然SAEs为层级结构提供了基础,但特征吸收可能会损害其质量。

  3. RESEARCH · CL_280574 ·

    新的3D世界模型提升机器人操作能力 · 跟踪5个来源

    研究人员开发了用于机器人操作的新3D世界模型创建方法。DepthWorld利用基于Stable Video Diffusion的模型,在RGB和深度数据上进行训练,以生成一致的3D环境,优于以前仅RGB的模型。另外,PointWAM通过将场景和手部动力学预测为点轨迹来专注于3D世界动作建模,从而能够有效地在人类演示视频上进行预训练,并在灵巧任务上优于现有方法。

  4. RESEARCH · CL_273515 ·

    新方法应对超低比特率生成式图像压缩

    两篇新研究论文提出了在极低比特率下进行生成式图像压缩的新方法。第一篇论文介绍了RAE-CoD,一种面向压缩的扩散模型,它使压缩表示和源表示对齐,即使在非常低的比特率下也能保持可识别的内容,在特征MSE和Fréchet距离方面优于竞争对手。第二篇论文提出了ResARC,一种残差感知自回归编解码器,它在解码器中显式补偿量化和生成残差,实现了具有竞争力的感知相似性和改进的分布保真度。

  5. RESEARCH · CL_271490 ·

    新研究探索用于自动驾驶安全与规划的高级AI · 追踪10个来源

    arXiv上发表的多篇研究论文探讨了自动驾驶系统的先进技术,重点是改进规划、预测和安全。其中一篇论文介绍了一个分层评估协议,用于评估生成场景模型的物理一致性,揭示了标准指标未显现的局限性。另一篇论文提出了Diffusion-2BC,一种用于离线行为克隆的混合扩散和回归训练方法,可提高闭环性能。此外,对规则对齐扩散规划器(RADP)的研究旨在将驾驶规则直接纳入扩散模型,以提高可解释性和安全性,同时正在开发Meta-多智能体强化学习(me…

  6. TOOL · CL_275885 ·

    Tex-Zero框架绕过3D资产进行原生3D纹理生成

    研究人员开发了Tex-Zero,一个无需3D资产进行训练即可生成3D纹理的新型框架。关键的见解是,高质量的颜色信息比精确的3D几何形状更重要,这使得可以使用丰富的2D图像作为训练数据。Tex-Zero通过将2D图像表示为平面并应用随机旋转和聚合来创建复杂的几何结构,从而将2D图像转换为3D训练样本。这种方法使得训练一个变分自编码器和一个扩散Transformer模型成为可能,该模型可以在训练期间从未见过真实3D资产的情况下,为真实3D…

  7. RESEARCH · CL_268209 ·

    新的AI方法增强图像恢复能力和适应性 · 跟踪4个来源

    研究人员开发了几种新的图像恢复方法,重点是提高模型的收敛性和适应性。一种方法为具有退火噪声水平的即插即用算法建立了收敛保证,适用于确定性和随机方法。另一种技术ImIR使用低秩适配器和图像派生指令来调整大型预训练图像编辑模型,从而实现任务无关的恢复。此外,一个名为Restoring without Forgetting (RwF) 的框架通过识别和调整特定于任务的滤波器来解决持续学习中的灾难性遗忘问题。最后,TaskIR提供了一个两阶段…

  8. TOOL · CL_259434 ·

    新的Q-BIOLAT框架使用二元编码优化蛋白质适应性景观

    研究人员开发了Q-BioLat,一个用于优化蛋白质适应性景观的新框架。该方法将蛋白质语言模型嵌入映射到紧凑的二元编码,从而能够使用二次无约束二元优化(QUBO)进行搜索。该框架强调了二元编码对优化过程的影响,表明即使在预测精度相似的情况下,不同的编码也会导致不同的搜索轨迹和局部最优解。使用ProteinGym的绿色荧光蛋白(GFP)和AAV适应性数据的实验表明,Q-BioLat,特别是与主成分分析(PCA)和中值阈值相结合时,在创建可…

  9. RESEARCH · CL_258505 ·

    New JiT-DDT architecture trains text-to-image models 3.6x faster

    研究人员开发了一种新颖的 JiT-DDT 架构,可显著加速文本到图像扩散模型的训练。通过将压缩和生成模块统一到单个模型中,JiT-DDT 与之前的 Latent Diffusion Models (LDMs) 等方法相比,GPU 时间减少了 3.6 倍。即使在生成四倍像素分辨率的图像时,也实现了这种效率的提高。代码和模型权重在 Apache 2.0 许可下公开可用,鼓励对更有效的训练技术进行进一步研究。

  10. TOOL · CL_256993 ·

    SafeFlow框架支持实时、物理引导的人形机器人控制

    研究人员开发了SafeFlow,一个用于实时文本驱动的人形机器人控制的新框架。该系统集成了物理引导的运动生成和多级安全门控,以确保生成的轨迹在物理上可行且对现实世界执行安全。SafeFlow利用变分自编码器潜在空间和校正流匹配方法,通过Reflow加速,来生成运动计划。其安全机制包括检测分布外提示、过滤不稳定生成以及在Unitree G1等机器人上执行前强制执行硬运动学约束。

  11. RESEARCH · CL_257223 ·

    SlotDiT 使用面向对象的槽来改进视频生成和机器人技术

    研究人员开发了 SlotDiT,这是一种新颖的文本引导扩散 Transformer,它利用面向对象的表示来改进视频生成和机器人应用。与依赖像素级或基于 VAE 的表示的先前模型不同,SlotDiT 将场景分解为不同的对象级“槽”。这种结构化方法允许模型自回归地预测未来的场景动态,在多个机器人数据集上产生具有竞争力的视频质量和更高的任务完成率。基于槽的表示的紧凑性质也提供了更具计算效率的替代方案。

  12. MEME · CL_253295 ·

    用户训练变分自编码器进行图像重建

    一位用户演示了如何训练一个变分自编码器(VAE)来重建一张嘈杂的猫的图像。该项目展示了VAE在图像处理和深度学习中的实际应用。

  13. TOOL · CL_253681 ·

    机器学习模型生成新颖的白葡萄酒配方

    一位机器学习爱好者使用PyTorch开发了一个变分自编码器(VAE)模型来生成新颖的白葡萄酒配方。该模型将现有葡萄酒映射到潜在空间,识别最佳区域,然后通过解码潜在坐标生成新配方。生成的配方得分在7.30到7.58之间,开发者正在寻求关于模型损失和整体性能的反馈。

  14. TOOL · CL_252246 ·

    新的3D CT到PET翻译使用潜在扩散模型

    研究人员开发了一种新颖的3D CT到PET翻译框架,使用了潜在布朗桥扩散(BBDM)。这种两阶段方法首先采用具有对比学习的变分自编码器(VAE)来对齐解剖(CT)和代谢(PET)数据的潜在表示。随后,BBDM翻译这些对齐的潜在表示,从而能够从CT扫描中合成类似PET的信息。该方法旨在减少PET成像相关的辐射暴露和成本,与现有方法相比,在保持代谢活性和病灶检测方面表现出更高的性能。

  15. TOOL · CL_247746 ·

    Halo方法通过估计分布尺度来提高预测准确性

    研究人员开发了一种名为Halo的方法,通过与位置参数一起估计分布的尺度参数来提高预测准确性。该方法重用了现有的深度预测器架构,并使用负对数似然目标进行训练,在各种模型和数据集上显示出均方误差(MSE)和平均绝对误差(MAE)的改进。研究发现,该方法的有效性主要取决于尺度估计,而不是尺度估计组件的具体架构,并且现有超参数通常可以重用。

  16. TOOL · CL_245478 ·

    BinauralVAE:用于AI世界模型的三维声场重建新流程

    研究人员推出了BinauralVAE,这是一个用于三维声场重建的开源流程,旨在为具身人工智能构建世界模型。该方法利用变分自编码器架构学习双耳信号的潜在表征,并在模拟机器人导航的真实声学数据上进行训练。该项目旨在为以音频为中心的世界模型奠定基础,使声音成为获取空间知识的补充模态,尤其是在视觉感知受限的场景中。

  17. TOOL · CL_245375 ·

    新的 PCFlow 框架生成逼真、物理一致的 GPR 图像

    研究人员开发了 PCFlow,一个用于生成逼真且物理一致的探地雷达 (GPR) B 扫描图像的新颖框架。该方法在变分自编码器潜在空间内利用物理条件流匹配方法。该框架包含一个由麦克斯韦方程启发的物理条件场,该场源自材料属性和目标几何形状等模拟参数,用于指导生成过程。在埋管数据集上的实验表明,PCFlow 能够生成具有准确几何响应和高视觉保真度的图像,使其能够进行可控且物理保真的雷达图像合成。

  18. RESEARCH · CL_247375 ·

    SenseNova-U1.5:统一视觉智能模型发布

    SenseNova-U1.5 是一个拥有80亿参数的多模态模型,专为统一视觉智能而设计。它无需传统的编码器或变分自编码器即可运行,在理解、推理和生成视觉内容方面实现了高保真度。该模型的能力通过补丁重建、精选数据、专业专家优化和 on-policy 蒸馏等技术得到增强,使其能够处理复杂指令并保持主体身份。

  19. TOOL · CL_243989 ·

    VAE通过压缩和重建图像来学习视觉模式

    变分自编码器(VAE)被用于压缩和重建图像。这个过程使AI模型能够从数据中学习视觉模式。

  20. TOOL · CL_242965 ·

    AuK:开源模型统一语音生成和编辑

    研究人员推出 AuK,一个用于语音生成和编辑的开源基础模型。该模型整合了自然语言指令和音频上下文,利用了多模态大语言模型、联合变分自编码器和混合整流流 Transformer。为了提高效率,AuK 已被蒸馏为 AuK-Flash,在不影响各种语音相关任务性能的情况下,显著加快了推理速度。