VoiceBench
PulseAugur coverage of VoiceBench — every cluster mentioning VoiceBench across labs, papers, and developer communities, ranked by signal.
-
KRAFTON发布双语语音模型A.X K2 Raon-Speech
KRAFTON发布了A.X K2 Raon-Speech,一个拥有212亿总参数和35亿活跃参数的双语(英语/韩语)语音语言模型。该多模态模型集成了SK Telecom的A.X K2 Light 20B-A3B的文本主干,以及KRAFTON AI独立开发的语音编码器和神经音频编解码器模块。该模型在语音识别、语音合成和问答等多种语音任务中表现出色,在300亿参数以下的公开可用模型中,其韩语和英语均位列前茅。
-
Alibaba releases Qwen-Audio-3.0-Realtime with enhanced voice AI capabilities
Alibaba has launched Qwen-Audio-3.0-Realtime, an upgraded real-time conversational voice model. This new version enhances intelligence, agent tool utilization, empathetic dialogue, and full-duplex interaction capabiliti…
-
ParaBridge 方法改进了语音模型的副语言理解能力
研究人员开发了 ParaBridge,一种新颖的 on-policy 自蒸馏方法,旨在提高语音语言模型将副语言线索纳入对话的能力。该技术训练模型更好地利用非词汇信息,如语气或背景噪音,以生成更恰当的响应。ParaBridge 在 VoxSafeBench 和 EchoMind 等基准测试中显著提高了性能,同时保持了通用的语言能力。
-
New Shapley Value method explains multimodal AI models
研究人员开发了一种新颖的 Shapley 值扩展方法,用于解释多模态多语言模型(MLLMs)的行为。该框架通过将文本和音频数据视为合作特征并采用高效的估计策略以实现计算可行性,来解决整合文本和音频数据所面临的挑战。该方法包括一种新的预处理方法 Spectrogram-Guided Phonetic Alignment (SGPA),用于将音频片段与文本对齐,并提供了一个带有 GUI 的开源软件包用于可视化。在 VoiceBench 和…
-
NVIDIA 发布 Nemotron 3 Nano Omni,统一多模态 AI 以提高效率
NVIDIA 发布了 Nemotron 3 Nano Omni,这是一个开放的多模态模型,能够处理文本、图像、音频和视频。该模型旨在将这些模态统一到单一架构中,从而提高效率并实现更复杂的人工智能智能体。Nemotron 3 Nano Omni 在文档智能、音频理解和视频分析的基准测试中表现出色,与之前的模型和替代方案相比,在吞吐量和推理速度方面均有显著提升。