PulseAugur
实时 05:44:56
实体 Kimi-Audio

Kimi-Audio

PulseAugur coverage of Kimi-Audio — every cluster mentioning Kimi-Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_193702 ·

    AI模型的情感神经元已跨语言识别和验证

    研究人员对大型音频语言模型(LALMs)进行了首次神经元级别可解释性研究,以了解它们如何在不同语言中编码情感。研究在Qwen2.5 Omni、Kimi-Audio和Audio Flamingo 3等模型中识别出了“多语言情感神经元”(MLENs)和“情感敏感神经元”(ESNs)。因果干预表明,当操纵这些特定神经元时,可以精确控制或降低模型识别和生成情感的能力,展示了语言特定和可跨语言迁移的情感能力。

  2. RESEARCH · CL_141076 ·

    新IAAN方法通过靶向编码器神经元提升LALM声学感知能力

    研究人员开发了一种名为IAAN(识别和放大声学神经元)的新方法,无需重新训练即可增强大型音频语言模型(LALM)的声学感知能力。这种无需训练、无需标签的技术专注于干预音频编码器本身,靶向单个神经元。通过对比真实音频与噪声参考的神经元激活情况,IAAN识别并放大关键神经元,显著提高了在情感等非语义语音属性上的性能。

  3. TOOL · CL_120166 ·

    FlexiSLM 为口语语言模型引入动态帧率

    研究人员开发了 FlexiSLM,这是一种新颖的口语语言模型,可以动态调整语音输入和输出的帧率。与使用固定帧率的现有模型不同,FlexiSLM 可以适应语音变化的信息密度,从而在质量和推理速度之间进行权衡。这种灵活性使 FlexiSLM 能够超越固定帧率模型,并在保持强大的语音到语音质量的同时显著减少推理时间。