Stable Audio 3
PulseAugur coverage of Stable Audio 3 — every cluster mentioning Stable Audio 3 across labs, papers, and developer communities, ranked by signal.
-
在H100 GPU上训练的游戏音乐生成器,旨在实现更广泛的风格范围
一位用户开发并训练了一个器乐游戏音乐生成器,这是一个拥有12亿参数的DiT模型。训练过程使用了单台云H100 GPU,耗时八天,并整合了Stable Audio 3的VAE。该项目旨在与Ace-Step、Minimax M3和Stable Audio 3等现有模型相比,产生更广泛的器乐风格,并且不生成歌词。该项目包含一个WebUI和示例音频文件,代码可在Hugging Face上获取。
-
MiniMax H3 开源权重视频 AI 可本地运行,媲美 Sora2
MiniMax 发布了其 H3 视频生成模型,并开放了权重,允许用户在消费级 GPU 上本地运行。该模型支持文本、图像、视频和音频输入,可生成长达 15 秒的立体声音频片段。其“全方位参考”(Omni Reference)功能使其能够参考多个图像、视频和音频文件以保持一致性,这是一种以前主要在闭源云服务中才能看到的功能。社区基准测试表明,H3 可与字节跳动的 Seedance 2.0 等领先模型相媲美甚至超越,并有可能超越 OpenA…
-
AI工具Stable Audio 3和LTX 2.3用于"Kinetic Abyss"动画制作
一位用户使用Stable Audio 3生成音频,并使用LTX 2.3处理视频,创作了名为"Kinetic Abyss"的2D动画。该动画在Reddit的r/StableDiffusion社区分享,展示了这些AI工具的集成应用。
-
新运行时使 Stable Audio 3 能够在 Raspberry Pi 5 上运行
研究人员开发了“aria”,这是一种新的、无依赖的语义音频生成运行时引擎,可在嵌入式设备上高效运行。这款基于 C 语言的引擎无需 Python 或深度学习框架,即可在 Raspberry Pi 5 和标准 CPU 等硬件上运行 Stable Audio 3 模型,并通过量化显著减少内存使用。Aria 还引入了激活引导,以实现对生成音频的更大控制,展示了面向“万物互联之声”应用的实际设备端音频生成能力。
-
kandinskylab发布KVAE-Audio,一款高保真音频自编码器
kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。
-
Stability AI 发布 Stable Audio 3.0 和 LTX 2.3 模型
Stability AI 发布了 Stable Audio 3.0(一个更新的文本到音频模型)以及 LTX 2.3(一个新的文本到图像模型)。Stable Audio 3.0 能够生成更长的音频片段,并提供对音频输出的改进控制。LTX 2.3 专为高保真图像生成而设计。
-
DEMON 音乐模型更新提升性能并增加 VST Alpha 版
DEMON 音乐模型已获得多项更新,包括更低的延迟、更高的吞吐量以及更简便的安装流程。VST Alpha 版本现已可供下载,未来还计划推出 Ableton 的 Max for Live 设备以及与 Stable Audio 3 的集成。该项目旨在让用户能够像演奏乐器一样实时演奏音乐模型。
-
Synchrotron 文本到视频模型结合了 Stable Audio 3 和 LTX 2.3
一款名为“Synchrotron”的新型文本到视频模型已发布,能够生成音频响应式视觉内容。该模型结合了 Stable Audio 3 和 LTX 2.3,暗示了先进音频合成和视频生成能力的集成。其输出展示了将文本提示和伴随音频转化为动态视频内容的复杂能力。
-
Stability AI 发布 Stable Audio 3,开放权重
Stability AI 发布了 Stable Audio 3,这是一个用于生成和编辑音频的新型潜在扩散模型系列。这些模型可以生成 44.1 kHz 的立体声音频,输出长度可变,并支持基于图像修复的编辑以实现更快的推理。此次发布包括较小模型规模的开放权重以及一份详细介绍该架构的技术论文,该架构采用了一种新颖的语义声学自动编码器和扩散 Transformer。
-
Stability AI 发布 Stable Audio 3 小型和中型模型
Stability AI 发布了其 Stable Audio 3 系列模型,包括小型和中型版本,旨在实现高效的可变长度音频生成和编辑。这些潜在扩散模型基于新颖的语义声学自动编码器运行,并利用对抗性后训练来提高速度和质量。这些模型在许可和知识共享数据上进行训练,可以在几秒钟内生成音乐和声音,小型和中型版本能够运行在消费级硬件上。