Kyūtai
PulseAugur coverage of Kyūtai — every cluster mentioning Kyūtai across labs, papers, and developer communities, ranked by signal.
-
Kyutai 发布开放权重 MuScriptor 用于多乐器音乐转录
法国 AI 实验室 Kyutai 推出了 MuScriptor,一个用于将多乐器音乐转录为 MIDI 格式的开放权重 Transformer 模型。该模型有三种尺寸,最大的拥有 14 亿参数。MuScriptor 在大量的 MIDI 文件和真实录音数据集上进行了训练,据报道其 Multi F1 分数达到了 48.2,显著优于基线模型。
-
AI语音初创公司Gradium融资1亿美元,获Nvidia投资
总部位于巴黎的AI语音初创公司Gradium在种子轮融资中获得了1亿美元,Nvidia作为新投资者参与了本轮融资。这笔资金将支持该公司扩展到湾区,以争夺人才并在全球AI生态系统中建立更强的存在感。Gradium是从AI实验室Kyutai分拆出来的,专注于开发超低延迟的音频模型,以实现近乎即时的AI语音响应,目标是与ElevenLabs和Google的Gemini等成熟公司竞争。
-
MuScriptor: 开放权重模型将多乐器音乐转录为MIDI
研究人员推出MuScriptor,一个用于多乐器音乐转录的开放权重模型。与以往在复杂混音或单一乐器上表现不佳的模型不同,MuScriptor能够将流行、古典、金属和爵士等多种音乐流派中各种乐器的音符转录为MIDI格式。该模型通过合成数据预训练、真实音频微调和强化学习的结合开发而成,并增加了基于乐器存在的条件设置能力。MuScriptor可在其官网使用,并在GitHub上提供开源代码。
-
基于《火箭联盟》数据训练的MIRA AI模型发布,并附带演示
一款名为MIRA的新AI模型已发布,该模型专为多人交互世界建模而设计,并在《火箭联盟》游戏数据上进行了训练。MIRA由General Intuition、Kyutai和Epic Games合作开发,拥有50亿参数,可在单个B200 GPU上以每秒20帧的速度运行。该项目包括一个可在线玩的演示、一份技术报告以及一个包含1000小时四人游戏数据的的数据集。
-
CPU TTS 评测:Pocket TTS 表现出平坦的 RTF,UTMOS 在自然度方面遇到困难
一项对四种基于 CPU 的文本转语音 (TTS) 模型——Kokoro、Supertonic、Inflect-Nano 和 Pocket TTS——的评测显示出不同的性能特征。Pocket TTS 采用流式语言模型架构,无论输入长度如何,其实时因子 (RTF) 保持一致,使其在交互式系统中具有可预测性。然而,UTMOS 评分指标显示出局限性,未能区分清晰但机械的输出和真正自然的语音,特别是对于 Inflect-Nano 等小型语音编码器。
-
Kyutai 的 Pocket TTS 提供基于 CPU 的语音克隆,仅需 5 秒音频
Kyutai 发布了 Pocket TTS,这是一个约 1 亿参数的流式语言模型,可自回归地生成音频令牌。该模型最值得注意的是,它能够从仅 5 秒的音频中进行零样本语音克隆,这是 Kokoro、Supertonic 和 Inflect-Nano 等其他 CPU 友好型模型所不具备的功能。虽然 Pocket TTS 是测试模型中最慢的,但它提供了在 CPU 上进行语音克隆的能力,而无需 GPU,使其成为交互式应用的独特选择。
-
新的开源MuScriptor模型可转录多乐器音乐
一款名为MuScriptor的新型开源模型已发布,用于自动音乐转录,能够将包含多种乐器的音频录音转换为详细的音符序列。该模型由Mirelo和Kyutai合作开发,提供大、中、小三个版本,其中大版本(约13亿参数)提供最高质量。该模型旨在用于研究目的,遵循知识共享许可,并附有关于法律合规和知识产权的特定条款。
-
Sakana AI 的 KAME 架构在不引入延迟的情况下将 LLM 知识注入语音 AI
Sakana AI 开发了 KAME,一种新颖的语音到语音 AI 串联架构,旨在结合直接系统的速度和基于 LLM 方法的知识深度。KAME 由两个异步组件运行:前端生成即时响应,后端 LLM 实时注入更丰富的知识。这使得系统能够在句子中间更新其响应,模仿人类对话调整而不会引入明显延迟。