EnCodec
PulseAugur coverage of EnCodec — every cluster mentioning EnCodec across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的 Text-Audiobox 框架实现了无需对齐的语音配音和对话合成
研究人员开发了无需对齐的 Text-Audiobox (Text-AB),一个用于语音配音和对话合成的新型框架。该系统利用具有流匹配目标的扩散 Transformer,并在使用 DAC-VAE 特征进行高保真音频压缩的潜在扩散框架内运行。一项关键创新是其无需对齐的方法,它通过交叉注意力学习文本-语音对齐,无需显式对齐或持续时间预测。该系统在 480,000 小时的海量语音数据集上进行了预训练,生成了一个拥有 30 亿参数的模型,能够进…
-
Meta的AI编解码器将歌曲压缩1000倍以用于QR码纸质存储
一位创客使用Meta的开源EnCodec AI神经音频编解码器,成功将一首两分钟的歌曲压缩了约1000倍。压缩后的歌曲从2.9MB减至约21KB,然后被打印在纸上的八个二维码中。播放歌曲需要使用与压缩相同的神经网络,这展示了一种新颖的数据存储和检索方法。
-
Meta 的 EnCodec 获得可移植 C++ 实现
Meta 的 EnCodec 音频编解码器已开发出 C++ 实现版本,旨在实现可移植性和高性能,无需外部机器学习运行时。该项目可在 GitHub 上找到,将模型权重直接编译到二进制文件中,以便于集成到 CMake 项目中。开发者正在寻求对该实现的反馈,据称其性能与 ONNX Runtime 相当或更优。
-
AI模型使用神经编解码器从MIDI生成鼓音频
研究人员开发了一个新系统,可以将富有表现力的鼓点网格(一种详细的MIDI格式)转换为逼真的鼓音频。该方法利用Transformer模型从神经音频编解码器预测离散代码,然后将这些代码解码为声音。使用EnCodec、DAC和X-Codec等编解码器进行的实验表明,音频表示的选择会显著影响合成鼓的质量。该系统在E-GMD数据集上进行了训练和评估,证明了编解码器-令牌预测是一种可行的打击乐合成方法。