RVQ
PulseAugur coverage of RVQ — every cluster mentioning RVQ across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
MiniMax发布可生成5分钟歌曲的开放权重音乐模型
MiniMax发布了MiniMax-Music3,这是一个开放权重模型,能够根据文本输入生成长达五分钟的完整歌曲。该模型接受带有章节标签的歌词和详细的音乐描述,生成32 kHz、16位立体声WAV音频。其架构结合了混合语言模型(Hybrid-LM),由一个8B的全局LLM和一个0.6B的局部LLM组成,以及一个利用流匹配(flow matching)和Flow-VAE的连续合成栈。MiniMax已公开提供权重、推理代码和服务路径,允许…
-
新的RFSQ方法通过改进信号条件增强神经压缩
研究人员开发了鲁棒残差有限标量量化(RFSQ),这是一种新的方法,通过解决多阶段量化中残差幅度衰减的问题来改进神经压缩。RFSQ 结合了可学习的缩放因子和可逆层归一化,以在量化阶段保持信号强度。实验表明,与现有方法相比,RFSQ-LayerNorm 在音频重建方面提高了 3.6%,在 ImageNet 上的 L1 和感知损失方面取得了显著的提高。
-
Inkling 多模态模型集成到 Hugging Face、vLLM;llama.cpp 添加音频输入
顶级国际象棋引擎 Stockfish 18 的最新版本与开源 AI 领域的重大进展同时发布。Hugging Face Transformers v5.14.0 和 vLLM v0.26.0 集成了新的 Inkling 多模态模型,这是一个来自 Thinking Machines 的 9750 亿参数模型,使开发人员能够轻松地将其用于各种任务。同时,llama.cpp 的 b10155 更新增加了对 MiMo-V2.5 音频输入和基于 …
-
新AI框架根据歌词和描述生成完整歌曲
研究人员开发了一个新颖的框架,可根据歌词、文本描述和音乐属性等各种输入生成完整歌曲。该系统支持三个不同的生成任务:从零开始创作带歌词的歌曲、制作器乐音乐以及生成不同风格的翻唱歌曲。该框架集成了语义感知分词器、混合语言模型(hybird-LM)、用于流匹配渲染的FullDiT以及旋律模块,并采用直接偏好优化(DPO)和GRPO等先进训练策略来增强音乐性和质量。
-
Self-Variable Robotics unveils X-Tokenizer for embodied AI action segmentation
Zibianliang (Self-Variable) Robotics has introduced X-Tokenizer, a novel cross-modal embodied action tokenizer designed to improve the semantic understanding between visual-language models (VLMs) and robot action expert…