PulseAugur
实时 07:26:10
实体 X-Codec2

X-Codec2

PulseAugur coverage of X-Codec2 — every cluster mentioning X-Codec2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_180446 ·

    DLLM-TTS框架实现更快、更准确的文本到语音合成

    研究人员推出了一种新颖的文本到语音合成框架DLLM-TTS,该框架解决了语音可懂度和生成速度之间的权衡问题。这种新方法将TTS表述为在X-Codec2神经音频编解码器令牌上的条件块状离散扩散。通过将序列分解为块并在每个块内应用掩码扩散,DLLM-TTS实现了高效的并行生成,实时因子为0.15,同时在Seed-TTS-eval等基准测试中保持了有竞争力的性能。

  2. SIGNIFICANT · CL_131038 ·

    NVIDIA 发布 Audex,一个统一的音频-文本大语言模型,保留文本智能

    NVIDIA 推出了 Audex (Nemotron-Labs-Audex-30B-A3B),一个能够理解和生成音频及语音的统一音频-文本大语言模型。与许多文本性能有所下降的多模态模型不同,Audex 的设计旨在保持其 Nemotron-Cascade-2-30B-A3B 骨干模型的文本智能。该模型通过多阶段训练过程和纯文本强化学习来实现这一点,从而在文本基准测试中取得有竞争力的分数,并具备强大的音频能力,包括超越语音的通用音频生成。