PulseAugur
中
实时 09:17:44
实体 RVQ

RVQ

PulseAugur coverage of RVQ — every cluster mentioning RVQ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_245603 ·

    新的SemDAC方法通过语义条件化提升语音压缩效果

    研究人员开发了一种新颖的神经语音压缩方法SemDAC,该方法优先考虑语义内容而非波形保真度。通过引入源自HuBERT特征的分层语义条件化,SemDAC在较低比特率下实现了比现有方法显著更高的压缩效率和识别鲁棒性。这种方法将重建引导至关键的语音信息,在各种客观和主观质量指标上优于更高比特率的基线。

  2. TOOL · CL_210581 ·

    新的几何检索方法增强了神经音频编解码器再合成

    研究人员引入了一种称为几何迭代检索的新方法,用于改进神经音频编解码器再合成。该方法利用残差向量量化 (RVQ) 码本的层次结构,在连续码本空间中执行迭代检索,超越了传统的离散标记预测或连续回归。该方法在语音和音乐恢复任务上进行了评估,证明比现有基线有所改进。

  3. SIGNIFICANT · CL_205166 ·

    MiniMax发布可生成5分钟歌曲的开放权重音乐模型

    MiniMax发布了MiniMax-Music3,这是一个开放权重模型,能够根据文本输入生成长达五分钟的完整歌曲。该模型接受带有章节标签的歌词和详细的音乐描述,生成32 kHz、16位立体声WAV音频。其架构结合了混合语言模型(Hybrid-LM),由一个8B的全局LLM和一个0.6B的局部LLM组成,以及一个利用流匹配(flow matching)和Flow-VAE的连续合成栈。MiniMax已公开提供权重、推理代码和服务路径,允许…

  4. TOOL · CL_174363 ·

    新的RFSQ方法通过改进信号条件增强神经压缩

    研究人员开发了鲁棒残差有限标量量化(RFSQ),这是一种新的方法,通过解决多阶段量化中残差幅度衰减的问题来改进神经压缩。RFSQ 结合了可学习的缩放因子和可逆层归一化,以在量化阶段保持信号强度。实验表明,与现有方法相比,RFSQ-LayerNorm 在音频重建方面提高了 3.6%,在 ImageNet 上的 L1 和感知损失方面取得了显著的提高。

  5. TOOL · CL_168090 ·

    Inkling 多模态模型集成到 Hugging Face、vLLM;llama.cpp 添加音频输入

    顶级国际象棋引擎 Stockfish 18 的最新版本与开源 AI 领域的重大进展同时发布。Hugging Face Transformers v5.14.0 和 vLLM v0.26.0 集成了新的 Inkling 多模态模型,这是一个来自 Thinking Machines 的 9750 亿参数模型,使开发人员能够轻松地将其用于各种任务。同时,llama.cpp 的 b10155 更新增加了对 MiMo-V2.5 音频输入和基于 …

  6. RESEARCH · CL_158609 ·

    新AI框架根据歌词和描述生成完整歌曲

    研究人员开发了一个新颖的框架,可根据歌词、文本描述和音乐属性等各种输入生成完整歌曲。该系统支持三个不同的生成任务:从零开始创作带歌词的歌曲、制作器乐音乐以及生成不同风格的翻唱歌曲。该框架集成了语义感知分词器、混合语言模型(hybird-LM)、用于流匹配渲染的FullDiT以及旋律模块,并采用直接偏好优化(DPO)和GRPO等先进训练策略来增强音乐性和质量。

  7. TOOL · CL_121922 ·

    Self-Variable Robotics unveils X-Tokenizer for embodied AI action segmentation

    Zibianliang (Self-Variable) Robotics has introduced X-Tokenizer, a novel cross-modal embodied action tokenizer designed to improve the semantic understanding between visual-language models (VLMs) and robot action expert…