PulseAugur
实时 15:38:28
实体 Residual Vector Quantization

Residual Vector Quantization

PulseAugur coverage of Residual Vector Quantization — every cluster mentioning Residual Vector Quantization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_252667 ·

    StepAudio 3 Gen 统一文本转语音、语音设计、音乐和音效

    研究人员推出 StepAudio 3 Gen,这是一种用于通用音频生成的新型离散自回归模型。该模型在一个框架内统一了文本转语音、语音设计、音效和音乐生成等各种音频任务。与之前的基于扩散 Transformer 的模型不同,StepAudio 3 Gen 在残差向量量化 (RVQ) 标记上运行,使其能够联合量化语义和声学特征。该模型在文本转语音和语音设计方面展示了最先进的性能,同时在其他音频领域保持了强大的能力。

  2. TOOL · CL_244915 ·

    新的SeRV方法增强了文本到美国手语的生成

    研究人员开发了SeRV,一种新颖的语义对齐残差向量量化方法,用于从文本生成美国手语(ASL)。该方法通过整合来自配对文本的显式语义监督,解决了现有方法的局限性,从而实现了更精确和语义一致的ASL运动生成。SeRV利用分层GPT以粗到精的方式预测残差运动令牌,在How2Sign和YouTube-ASL等基准数据集上达到了最先进的姿态精度。

  3. TOOL · CL_210581 ·

    新的几何检索方法增强了神经音频编解码器再合成

    研究人员引入了一种称为几何迭代检索的新方法,用于改进神经音频编解码器再合成。该方法利用残差向量量化 (RVQ) 码本的层次结构,在连续码本空间中执行迭代检索,超越了传统的离散标记预测或连续回归。该方法在语音和音乐恢复任务上进行了评估,证明比现有基线有所改进。

  4. TOOL · CL_167734 ·

    新的非对称分层锚定框架提高了跨模态泛化能力

    研究人员开发了一个名为非对称分层锚定(AHA)的新框架,以改进机器学习中不同模态之间的知识迁移。该方法通过结构化语义层级强制执行信息定向分配,解决了现有对称方法的局限性。AHA 利用残差向量量化来指导视频特征蒸馏,并采用对抗解耦器来防止模态间的语义泄露,同时结合局部滑动对齐进行细粒度的时间同步。在 AVE 和 AVVP 基准上的实验表明,AHA 在跨模态迁移方面优于对称基线,进一步分析表明其学习到的表示在语义一致性和解耦方面有所改进。

  5. RESEARCH · CL_167570 ·

    Apple 发布用于 Siri 的内存高效设备端音频合成

    Apple 在一篇研究论文中详细介绍了一种新的内存高效的设备端音频合成架构。该系统为 Siri Expressive Voices 提供支持,使用扩散 Transformer (DiT) 风格的解码器,以最少的计算资源将语义音频令牌转换为高保真语音。该架构实现了实时合成速度,仅需约 21MB 运行时内存,并与之前的设备端系统相比显著提高了音频质量指标。