PulseAugur
实时 16:37:05
实体 EnCodec

EnCodec

PulseAugur coverage of EnCodec — every cluster mentioning EnCodec across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_235532 ·

    新的 Text-Audiobox 框架实现了无需对齐的语音配音和对话合成

    研究人员开发了无需对齐的 Text-Audiobox (Text-AB),一个用于语音配音和对话合成的新型框架。该系统利用具有流匹配目标的扩散 Transformer,并在使用 DAC-VAE 特征进行高保真音频压缩的潜在扩散框架内运行。一项关键创新是其无需对齐的方法,它通过交叉注意力学习文本-语音对齐,无需显式对齐或持续时间预测。该系统在 480,000 小时的海量语音数据集上进行了预训练,生成了一个拥有 30 亿参数的模型,能够进…

  2. TOOL · CL_203183 ·

    Meta的AI编解码器将歌曲压缩1000倍以用于QR码纸质存储

    一位创客使用Meta的开源EnCodec AI神经音频编解码器,成功将一首两分钟的歌曲压缩了约1000倍。压缩后的歌曲从2.9MB减至约21KB,然后被打印在纸上的八个二维码中。播放歌曲需要使用与压缩相同的神经网络,这展示了一种新颖的数据存储和检索方法。

  3. TOOL · CL_68934 ·

    Meta 的 EnCodec 获得可移植 C++ 实现

    Meta 的 EnCodec 音频编解码器已开发出 C++ 实现版本,旨在实现可移植性和高性能,无需外部机器学习运行时。该项目可在 GitHub 上找到,将模型权重直接编译到二进制文件中,以便于集成到 CMake 项目中。开发者正在寻求对该实现的反馈,据称其性能与 ONNX Runtime 相当或更优。

  4. TOOL · CL_27490 ·

    AI模型使用神经编解码器从MIDI生成鼓音频

    研究人员开发了一个新系统,可以将富有表现力的鼓点网格(一种详细的MIDI格式)转换为逼真的鼓音频。该方法利用Transformer模型从神经音频编解码器预测离散代码,然后将这些代码解码为声音。使用EnCodec、DAC和X-Codec等编解码器进行的实验表明,音频表示的选择会显著影响合成鼓的质量。该系统在E-GMD数据集上进行了训练和评估,证明了编解码器-令牌预测是一种可行的打击乐合成方法。