PulseAugur
中
实时 17:44:09
实体 Kimi-Audio

Kimi-Audio

PulseAugur coverage of Kimi-Audio — every cluster mentioning Kimi-Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_252268 ·

    新研究通过跨语言和多模态方法解决深度伪造检测问题 · 跟踪4个来源

    研究人员正在开发先进的音频和视频深度伪造检测方法,重点是提高跨不同语言和未见攻击类型的泛化能力。一种名为“语言正交化”的方法旨在从语音模型中去除特定语言的变体,以增强跨语言检测能力。另一种名为CRAF的方法融合了来自自监督学习模型和听觉大语言模型的互补表示,以提高鲁棒性。此外,R2M提供了一个无需训练的框架,通过分离共享组件和生成器特定的伪影来合并深度伪造检测模型,而MARE则利用带有强化学习的视觉-语言模型来创建可解释的深度伪造检测系统。

  2. RESEARCH · CL_193702 ·

    AI模型的情感神经元已跨语言识别和验证

    研究人员对大型音频语言模型(LALMs)进行了首次神经元级别可解释性研究,以了解它们如何在不同语言中编码情感。研究在Qwen2.5 Omni、Kimi-Audio和Audio Flamingo 3等模型中识别出了“多语言情感神经元”(MLENs)和“情感敏感神经元”(ESNs)。因果干预表明,当操纵这些特定神经元时,可以精确控制或降低模型识别和生成情感的能力,展示了语言特定和可跨语言迁移的情感能力。

  3. RESEARCH · CL_141076 ·

    新IAAN方法通过靶向编码器神经元提升LALM声学感知能力

    研究人员开发了一种名为IAAN(识别和放大声学神经元)的新方法,无需重新训练即可增强大型音频语言模型(LALM)的声学感知能力。这种无需训练、无需标签的技术专注于干预音频编码器本身,靶向单个神经元。通过对比真实音频与噪声参考的神经元激活情况,IAAN识别并放大关键神经元,显著提高了在情感等非语义语音属性上的性能。

  4. TOOL · CL_120166 ·

    FlexiSLM 为口语语言模型引入动态帧率

    研究人员开发了 FlexiSLM,这是一种新颖的口语语言模型,可以动态调整语音输入和输出的帧率。与使用固定帧率的现有模型不同,FlexiSLM 可以适应语音变化的信息密度,从而在质量和推理速度之间进行权衡。这种灵活性使 FlexiSLM 能够超越固定帧率模型,并在保持强大的语音到语音质量的同时显著减少推理时间。