PulseAugur
实时 15:52:55
实体 MMAudio

MMAudio

PulseAugur coverage of MMAudio — every cluster mentioning MMAudio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_187439 ·

    新的KVAE分词器旨在推进多模态生成模型

    研究人员推出了一系列名为KVAE的新型分词器,专为多模态生成模型设计。这些分词器,包括KVAE-Audio、KVAE-3D和KVAE-2D,专门为跨音频、视频和图像数据的文本条件生成任务而构建。该论文详细介绍了这些模型的开发、训练和消融研究,并与社区分享了代码和训练细节。评估表明,KVAE分词器在各种重建和生成指标上均达到或超过了现有开源替代品的性能。

  2. TOOL · CL_123983 ·

    kandinskylab发布KVAE-Audio,一款高保真音频自编码器

    kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。

  3. TOOL · CL_50110 ·

    开源工作流生成“Pirate Movie”测试版预告片

    一部名为“Pirate Movie”的测试版预告片已发布,展示了使用全开源技术栈生成电影预告片的工作流程。该项目利用SDXL生成基础图像,Qwen Image Edit进行调整,LTX 2.3进行动画制作,MMAudio负责音效,Ace-Step-1.5-XL创作主题音乐。创作者计划将预告片扩展到两分钟,并承认对于电影剪辑新手来说,这是一项巨大的挑战。

  4. RESEARCH · CL_14085 ·

    MMAudioReverbs 利用视频改进音频去混响和RIR估计

    研究人员开发了MMAudioReverbs,一个利用预训练的视频到音频(V2A)模型进行声学处理任务的新型框架。这种方法可以在不改变核心V2A模型架构的情况下实现去混响和房间冲激响应估计。实验表明,结合视觉和听觉线索可以增强对物理房间声学的理解,这表明基础V2A模型拥有适用于声音分析的隐式知识。