Moshi
PulseAugur coverage of Moshi — every cluster mentioning Moshi across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新研究探索全双工对话模型、记忆和轮流发言
研究人员正在开发改进全双工口语对话模型的新方法,这些模型允许同时进行听和说。一种方法 PERSIST 引入了一个记忆系统,该系统跟踪谁在何时说了什么,从而显著降低了检索延迟。另一个关注点是这些模型在相互交互时的轮流发言行为,研究表明它们的时序是耦合的,但与人类对话相比通常会延迟。正在提出 DyaFDB 和 HiPLEX 等新框架来评估和改进这些模型,考虑它们的二元交互和分层策略分解,以获得更好的时序和内容协调。
-
新方法抑制全双工大语言模型的虚假语音
研究人员已识别并解决了全双工语音大语言模型中存在的一个问题,即像 Moshi 和 PersonaPlex 这样的模型会在用户长时间沉默期间不当地启动语音。该问题源于语音概率的突然激增,而非重复采样。开发了一种新的推理时方法,通过评估在用户输入被静音的情况下模型的响应是否会发生变化来抑制这些虚假启动,成功消除了所有测试的虚假启动,且不影响真实响应。
-
RetroThinker框架提升语音LLM推理准确性
研究人员开发了RetroThinker,一个新颖的训练后框架,旨在增强基于语音的大语言模型(SpeechLLMs)的推理能力。该框架使Moshi等模型能够在推理过程中自我验证和纠正其推理步骤,解决了实时语音交互中准确性和延迟的固有权衡。在GSM8K基准上的评估表明,RetroThinker在不显著增加延迟的情况下显著提高了准确性,在可比速度下实现了11%的绝对准确率提升。
-
新的AV-STE系统通过视听语音令牌恢复增强对话模型
研究人员开发了AV-STE,一个新颖的模块化前端系统,旨在增强用于语音对话模型的视听语音令牌处理。该系统旨在通过在主要语言模型处理之前从嘈杂的音频和唇部视频中恢复损坏的语音令牌,来提高全双工对话系统的鲁棒性。通过保持下游对话模型冻结,AV-STE在保留其现有会话能力的同时,显著提高了响应连贯性,尤其是在有重叠语音的嘈杂环境中。
-
新数据集和模型推动全双工口语对话研究
研究人员推出了专注于全双工口语对话系统的新数据集和模型,这些系统能够实现更自然、实时的对话交互。DuplexDrama 数据集提供了超过 2000 小时的合成音频数据,涵盖场景、富有表现力的语音和声音事件,并将发布部分双语对话。SteerDuplex 引入了一个用于可控全双工语音的模型和基准,允许控制音调和语速等属性,并在指令遵循和中断处理方面取得了显著改进。此外,ConversationalVoice 提供了一个从真实对话创建训练数…
-
Mimi 编解码器的语义令牌与语音实现相关联
研究人员调查了 Mimi 编解码器,这是 Moshi 语言模型的一个组成部分,重点关注其 2048 令牌语义词汇表。他们的研究结果表明,标准的 ABX 实验不足以理解语义令牌与其语音实现之间的关系。通过将 Mimi 表示与 TIMIT 语料库转录对齐,该研究证明了这些语义令牌对应于各种语音单元,包括四音素、三音素、双音素、音素和亚音素。
-
Metronome 系统约束 AI 模型缓存以实现实时交互稳定性
研究人员开发了一个名为 Metronome 的新系统,旨在改进交互式 AI 模型的实时服务。这类模型,例如 Moshi、MiniCPM-o 和 Qwen Omni,面临一个关键问题:持续负载可能导致突然的、灾难性的故障,而不是逐渐的性能下降。Metronome 通过约束每个会话的缓存大小来解决这个问题,从而提高稳定性和对系统性能的可观测性。这种约束机制可以防止 KV 缓存耗尽其容量,使在线准入控制器能够准确确定可调度的并发量并避免过度准入。
-
新的对话系统将实时面部生成与语音相结合
研究人员开发了Moshi-Face,一个新颖的全双工语音对话系统,它将面部生成与音频处理相结合。该系统利用VQ-VAE将面部数据编码为离散令牌,并使用Face Transformer非自回归地生成这些令牌。其结果是一个能够实时生成同步语音和面部表情的模型,在实现低延迟视听对齐的同时保持对话质量。
-
BayLing-Duplex 使单个 LLM 能够实现原生全双工语音对话
研究人员开发了 BayLing-Duplex,这是一种新颖的全双工语音语言模型,无需依赖外部轮流模块即可实现同时听和说。这个单一的自回归 LLM 可以处理自然的对话现象,如打断和犹豫。通过一个适度的数据集进行微调,BayLing-Duplex 在轮流和打断处理方面表现出很高的成功率,同时与基于轮流的模型相比,保持或提高了响应质量。
-
Moshi对话模型展现同步内部状态并预测轮流
研究人员探讨了全双工语音对话模型在交互过程中如何协调其内部表征。通过模拟两个Moshi模型实例之间的对话,他们观察到在理想条件下存在强烈的表征同步,但随着信道噪声的增加,同步性会下降。研究还发现,这些模型的内部状态编码了预期信息,使其能够提前预测轮流提示。
-
Thinking Machines 预览实时 AI 协作的交互模型
Thinking Machines 推出了一项交互模型的研究预览,该模型专为原生、实时的协作而设计。这些模型可同时处理音频、视频和文本,实现持续的思考、响应和行动。这种方法旨在克服当前基于回合制的 AI 界面的局限性,从而实现更自然、更流畅的人机协作,模仿人与人之间的互动。
-
新方法提升全双工语音模型以实现更好的交互
研究人员开发了新的方法来增强全双工语音模型,从而实现更自然、更具交互性的对话。一种方法侧重于使用强化学习来改进暂停处理和轮流发言等交互轴,并将其应用于 Moshi 和 PersonaPlex 等模型。另一种方法,Listen-Write-Speak (LWS),引入了一种以文本为中心的范式,模型可以同时收听、写入可见文本并进行语音输出,利用文本原生能力而不牺牲实时响应能力。
-
Sakana AI 的 KAME 架构在不引入延迟的情况下将 LLM 知识注入语音 AI
Sakana AI 开发了 KAME,一种新颖的语音到语音 AI 串联架构,旨在结合直接系统的速度和基于 LLM 方法的知识深度。KAME 由两个异步组件运行:前端生成即时响应,后端 LLM 实时注入更丰富的知识。这使得系统能够在句子中间更新其响应,模仿人类对话调整而不会引入明显延迟。
-
Josh Talks 发布首个全双工印地语对话 AI 模型
研究人员开发了首个开放且可复现的印地语全双工口语对话系统。该系统名为 Human-1,改编自 Moshi 架构,并在近 15,000 名说话者提供的 26,000 多小时的真实对话上进行了训练。该模型旨在处理诸如打断和重叠等自然对话元素,目标是实现更自然的印地语以及潜在的其他印度语言的实时口语互动。