PulseAugur
实时 04:02:51
实体 variational auto-encoder

variational auto-encoder

PulseAugur coverage of variational auto-encoder — every cluster mentioning variational auto-encoder across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
42
90 天内 163
发布 · 30天
0
90 天内 0
论文 · 30天
34
90 天内 143
层级分布 · 90 天
主题
关系
情绪 · 30 天

19 天有情绪数据

最近 · 第 1/9 页 · 共 163 条
  1. RESEARCH · CL_212113 ·

    新的VAE框架提高了概率时间序列预测的准确性

    两篇新的研究论文介绍了一种用于概率时间序列预测的高级变分自编码器(VAE)框架。第一个模型CLaST使用对比损失函数来学习保留上下文相似性的嵌入,在九个基准测试中CRPS和NMAE均有显著提高。第二个框架DecoVAE被设计为轻量级和可解释的,它将时间序列显式地分解为趋势和季节性分量。与现有方法相比,DecoVAE还展示了卓越的准确性和效率,减少了模型权重并加快了速度。

  2. TOOL · CL_210911 ·

    MiniMax H3用户寻求VAE优化以加快视频生成速度

    Reddit的r/StableDiffusion板块的一位用户正寻求优化MiniMax H3(一款视频生成模型)的生成速度。性能分析表明,变分自编码器(VAE)解码过程占总生成时间的约43%,在高端RTX 4090 GPU上,每15秒视频的生成时间约为5.5分钟。用户已尝试了几种优化方法,包括使用fp8mix VAE和不同的时间分块策略,但改进甚微。他们正在询问是否有可能使用与WanGP设置兼容的更快的VAE,更新CUDA和PyTor…

  3. RESEARCH · CL_212012 ·

    新的SEFS框架使扩散模型风格化无需辅助编码器

    研究人员为扩散模型开发了一个名为SEFS(Style-Encoder-Free Stylization,无风格编码器风格化)的新框架,该框架允许在不需要对齐的内容-风格-目标三元组或辅助视觉编码器的情况下进行风格迁移。SEFS从单个训练图像的低分辨率裁剪中生成风格令牌,保留局部外观统计信息,同时最大限度地减少不期望的场景结构的迁移。该框架还为目标内容纳入了边缘和分割线索,并使用风格到去噪的重新归一化技术进行令牌对齐,并计划公开提供代码。

  4. RESEARCH · CL_206009 ·

    LLM在医疗应用和罕见病建模方面得到评估

    研究人员开发了两种利用大语言模型(LLM)的独特方法。第一种是HealMed,一个用于医学领域LLM多语言评估的新基准,包含九种语言的1000个示例,由23名医学专家开发。第二种方法利用LLM作为合成临床专家,以改进罕见病的纵向建模,特别是通过将LLM衍生的临床知识整合到变分自编码器中,成功预测了脊髓性肌萎缩症儿童的运动功能里程碑。

  5. RESEARCH · CL_208194 ·

    GS-Voxel框架支持从非结构化数据生成可扩展的3D场景

    研究人员开发了GS-Voxel,一个旨在将非结构化的3D高斯泼溅(3DGS)重建转换为结构化潜在表示的新型框架。该方法通过利用图像条件流模型,实现了大规模3D场景(特别是航空环境)的可扩展生成。与需要每场景优化的先前方法不同,GS-Voxel确定性地将现有的3DGS数据转换为稀疏体素,将几何和属性编码到随占用体素增长而非固定图元数量增长的潜在表示中。

  6. TOOL · CL_205244 ·

    像 Stable Diffusion 这样的 AI 图像模型现在通过 TypeScript 在浏览器中运行

    ONNX Runtime Web 和 WebGPU 的最新进展使得像 Stable Diffusion 和 Flux 这样的复杂 AI 模型能够直接在浏览器中使用 TypeScript 运行。这一转变将 AI 模型执行从专用的后端基础设施转移到客户端或边缘设备,显著改变了全栈工程实践。文章详细介绍了潜在扩散模型(LDMs)和校正流匹配(Rectified Flow Matching)的机制,解释了它们如何在压缩的潜在空间中运行,并利用…

  7. TOOL · CL_203908 ·

    解耦表示提升形态转录组整合

    研究人员探索了通过解耦共享和模态特定变异来改进空间转录组学和苏木精-伊红(H&E)成像数据整合的方法。他们比较了变分自编码器(VAE)和对比学习方法,发现对比学习目标通常能带来更好的下游探测性能。该研究表明,显式地分解共享信息可以增强空间转录组学多模态表示学习,为评估未来的基础模型提供了一个框架。

  8. RESEARCH · CL_206662 ·

    PixRestore:无VAE的像素扩散Transformer用于图像修复

    研究人员开发了PixRestore,一种利用无VAE的像素空间扩散Transformer的新型图像修复模型。与以往适配文本到图像模型的方法不同,PixRestore在补丁化像素上从头开始训练,保留了细粒度的细节并避免了内容不一致的伪影。该模型通过预测DINO特征相似性的特征可靠性,融合可靠的层特征作为条件,并监督不太可靠的层以去除退化,从而适应各种退化。PixRestore通过约5000万个参数和单步推理展示了高效率,与现有模型相比,…

  9. TOOL · CL_198251 ·

    新AI模型通过预测笔画顺序场生成有序矢量草图

    研究人员开发了一种新颖的草图生成方法,颠覆了传统的逐笔画方式。他们的模型不预测笔画顺序,而是生成一个决定绘制序列的二维场。该系统利用潜在流匹配Transformer进行图像先验学习,并使用变分自编码器预测中间表示,包括顺序场、笔画掩码和分割。然后根据顺序场对预测的分割进行矢量化和排序,从而生成可从文本描述生成或通过反渲染图像生成的有序矢量草图。

  10. RESEARCH · CL_200250 ·

    PixSDS方法减少文本到3D生成中的伪影

    研究人员开发了PixSDS,这是一种解决文本到3D生成中由潜在得分蒸馏采样(SDS)引起的伪影的新方法。该技术通过使用解码图像方向来指导优化,从而减少噪声并保留语义内容,从而解决VAE引起的像素漂移。PixSDS无需重新训练扩散模型或更改渲染器即可运行,为提高生成3D资产的质量提供了一种轻量级解决方案。

  11. TOOL · CL_195844 ·

    LTX 2.5用户通过ConvRot视频VAE实现显著加速

    Reddit的r/StableDiffusion板块的一位用户分享了一个提高LTX 2.5生成时间的技巧。通过切换到ConvRot视频VAE,用户可以显著减少生成图像所需的时间。该帖子包含一个表格,比较了标准VAE与ConvRot VAE的生成速度,显示在各种分辨率和生成时间下,速度提升约2倍至4倍以上。

  12. TOOL · CL_196244 ·

    Flex-π 模型将 3D 几何和对象语义与 RGB 数据集成

    研究人员开发了 Flex-$\pi$,一个拥有 60 亿参数的世界动作模型,该模型将 3D 几何和对象语义与 RGB 数据集成在一起。该模型利用预训练的视频生成 VAE,无需额外训练即可编码 3D 点图,从而实现统一的潜在空间。Flex-$\pi$ 使用了具有跨模态强制的 Transformer 混合骨干网络,使其能够高效地处理输入流的各种子集。该模型在真实世界双臂操作任务的演示效率和泛化能力方面表现出显著的改进,优于现有基线。

  13. TOOL · CL_196239 ·

    新的潜在桥接匹配框架从对比前图像合成乳腺MRI

    研究人员开发了一种名为潜在桥接匹配(LBM)的新框架,用于从对比前图像合成增强对比的乳腺DCE-MRI。该方法利用潜在扩散模型(LDM)方法,但学习配对的对比前和峰值增强VAE潜在变量之间的条件桥接,从而实现迭代优化。在验证队列上的评估表明,与标准的LDM基线相比,LBM(特别是带有肿瘤条件)在均方误差(MSE)和弗雷歇距离(FRD)等性能指标上有所提高。

  14. TOOL · CL_195981 ·

    新的ELVAE模型增强了VAE中的不确定性感知生成能力

    研究人员开发了ELVAE,一种新的变分自编码器,它结合了证据学习,以更好地区分潜在表示中的不确定性及其周围的可变性。这种方法允许在生成过程中显式控制潜在位置的不确定性,从而能够创建更可靠的合成样本,或通过利用高不确定性锚点来对模型进行压力测试。在MNIST生成上的初步实验表明,这种学习到的不确定性可以有效地区分生成数字的语义可靠性,为不确定性感知生成提供了一个实用的控制变量。

  15. RESEARCH · CL_198089 ·

    TailBooster框架通过合成数据增强AI对极端事件的预测能力

    研究人员开发了TailBooster,一种新颖的双层生成框架,旨在通过增强极端事件示例数据来改进机器学习模型。该框架解决了传统方法中稀有事件代表性不足和可能生成操作上不可行数据的问题。TailBooster结合了极端值的统计提取和一个基于自动编码器的清理层,以确保合成数据既能代表尾部数据,又能遵守操作约束。在美国航班记录上的评估表明,在预测极端飞行时间和到达延误方面取得了显著改进,平均绝对误差降低了高达57%。

  16. TOOL · CL_193683 ·

    新研究提出通过函数正交性实现无监督解耦

    一篇新的研究论文提出了一种新颖的无监督解耦表示学习方法,将潜在概念构建为通过局部正交方向影响观测值的因素。该方法通过对生成映射的雅可比矩阵施加正交性约束来形式化,旨在在不依赖统计独立性或因果假设的情况下,在非线性生成模型中实现可辨识性。使用正交性正则化归一化流的实验已在经验上验证了该理论,展示了对真实因素的可靠恢复,并为变分自编码器(VAE)的有效性提供了见解。这些发现挑战了先前关于无监督解耦不可能性的说法,并提出了一种有原则的替代方案。

  17. TOOL · CL_193511 ·

    UniSpace 推出统一视觉表示,用于 AI 生成和编辑

    研究人员开发了 UniSpace,一种新颖的视觉表示方法,可在单个模型中统一理解、生成和编辑任务。通过引入“Patch Reparameterization”(块重参数化),UniSpace 修改了预训练的语义 ViT,以在保留语义抽象的同时保持细粒度的视觉细节。该方法能够实现高保真图像重建,并在重建质量和生成质量之间取得平衡。UniSpace 模型采用 8B Transformer 专家混合架构,无需单独的变分自编码器通路,即可有效…

  18. TOOL · CL_193510 ·

    CuteTTS系统通过连续自回归建模增强语音合成

    研究人员开发了CuteTTS,一个新颖的文本到语音系统,旨在实现高效高质量的语音合成。该系统利用变分自编码器潜在变量和块级自回归的连续自回归建模,以平衡保真度和低延迟推理。通过一种称为引导步蒸馏的技术,CuteTTS显著降低了延迟并提高了实时因子,同时保持了与基础模型相当的客观和主观质量。

  19. RESEARCH · CL_195675 ·

    Latent-to-4D 方法可从视频潜在表示生成可复用的三维场景

    研究人员开发了 Latent-to-4D,一种从文本或图像生成动态三维场景的新颖方法。该方法通过将视频扩散潜在表示与四维解码器直接对齐,绕过了重建 RGB 视频的需要。在相同的变分自编码器家族内,单个训练好的检查点可以跨不同的视频扩散 Transformer 重用,在 Text4D-200 和 I4D-200 等基准测试中展示了比现有方法更好的性能和人类偏好。

  20. FRONTIER RELEASE · CL_187763 ·

    MiniMax H3 开源权重视频 AI 可本地运行,媲美 Sora2

    MiniMax 发布了其 H3 视频生成模型,并开放了权重,允许用户在消费级 GPU 上本地运行。该模型支持文本、图像、视频和音频输入,可生成长达 15 秒的立体声音频片段。其“全方位参考”(Omni Reference)功能使其能够参考多个图像、视频和音频文件以保持一致性,这是一种以前主要在闭源云服务中才能看到的功能。社区基准测试表明,H3 可与字节跳动的 Seedance 2.0 等领先模型相媲美甚至超越,并有可能超越 OpenA…