Kimi-Audio
PulseAugur coverage of Kimi-Audio — every cluster mentioning Kimi-Audio across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究通过跨语言和多模态方法解决深度伪造检测问题 · 跟踪4个来源
研究人员正在开发先进的音频和视频深度伪造检测方法,重点是提高跨不同语言和未见攻击类型的泛化能力。一种名为“语言正交化”的方法旨在从语音模型中去除特定语言的变体,以增强跨语言检测能力。另一种名为CRAF的方法融合了来自自监督学习模型和听觉大语言模型的互补表示,以提高鲁棒性。此外,R2M提供了一个无需训练的框架,通过分离共享组件和生成器特定的伪影来合并深度伪造检测模型,而MARE则利用带有强化学习的视觉-语言模型来创建可解释的深度伪造检测系统。
-
AI模型的情感神经元已跨语言识别和验证
研究人员对大型音频语言模型(LALMs)进行了首次神经元级别可解释性研究,以了解它们如何在不同语言中编码情感。研究在Qwen2.5 Omni、Kimi-Audio和Audio Flamingo 3等模型中识别出了“多语言情感神经元”(MLENs)和“情感敏感神经元”(ESNs)。因果干预表明,当操纵这些特定神经元时,可以精确控制或降低模型识别和生成情感的能力,展示了语言特定和可跨语言迁移的情感能力。
-
新IAAN方法通过靶向编码器神经元提升LALM声学感知能力
研究人员开发了一种名为IAAN(识别和放大声学神经元)的新方法,无需重新训练即可增强大型音频语言模型(LALM)的声学感知能力。这种无需训练、无需标签的技术专注于干预音频编码器本身,靶向单个神经元。通过对比真实音频与噪声参考的神经元激活情况,IAAN识别并放大关键神经元,显著提高了在情感等非语义语音属性上的性能。
-
FlexiSLM 为口语语言模型引入动态帧率
研究人员开发了 FlexiSLM,这是一种新颖的口语语言模型,可以动态调整语音输入和输出的帧率。与使用固定帧率的现有模型不同,FlexiSLM 可以适应语音变化的信息密度,从而在质量和推理速度之间进行权衡。这种灵活性使 FlexiSLM 能够超越固定帧率模型,并在保持强大的语音到语音质量的同时显著减少推理时间。