PulseAugur
中
实时 15:23:52
实体 MMAU-Pro

MMAU-Pro

PulseAugur coverage of MMAU-Pro — every cluster mentioning MMAU-Pro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_284716 ·

    SkillFormer 使用技能适配器来适应音频语言模型

    研究人员开发了 SkillFormer,这是一种用于适应音频语言模型以完成各种任务的新方法。该方法将音频理解分解为特定技能的适配器,这些适配器在推理时通过学习到的路由器进行组合。这种技术可以防止在联合训练期间可能出现的不同技能(如音高比较和说话人计数)之间的干扰。SkillFormer 为基础模型增加了最少的参数,并在多个基准测试中显示出显著的准确性提升。

  2. TOOL · CL_284692 ·

    AdaLoop 通过自适应推理增强音频语言模型

    研究人员开发了 AdaLoop,这是一个旨在增强大型音频语言模型推理能力的新型模块。该模块自适应地确定音频相关查询所需的计算深度,对复杂的声学分析任务应用更多的迭代细化。AdaLoop 可与现有音频模型无缝集成,仅增加少量参数即可显著提高 MMSU、MMAU-Pro 和 MMAR 等基准的准确性。

  3. RESEARCH · CL_254876 ·

    Realtime-Venus系统实现全双工交互,采用双AI模型 · 追踪2个来源

    研究人员推出Realtime-Venus,一个旨在实现更自然人机交互的新型全双工交互系统。该系统利用两个专门的9B模型:Realtime-Venus-Omni用于视听任务,Realtime-Venus-Audio用于语音交互。这些模型通过共享时间线整合了连续感知、对话控制和语音生成,允许在不中断前景对话的情况下进行异步后台推理和工具执行。Realtime-Venus-Omni在视频基准测试中表现强劲,而Realtime-Venus-A…

  4. TOOL · CL_210497 ·

    新型LALM模型通过无指令对齐实现具有竞争力的多模态性能

    研究人员开发了一种新颖的多模态大语言模型(MLLM)创建方法,该方法仅关注对齐,绕过了传统的多阶段流程。这种新方法称为LALM,仅训练一个轻量级投影仪,同时保持音频编码器和核心LLM的冻结状态。通过利用自生成数据和无指令训练,LALM在各种基准测试中取得了具有竞争力的性能,使用的数据量大大减少,却能媲美甚至超越经过大量后训练的模型。该技术保留了LLM固有的指令遵循能力,并允许快速适应新的LLM代和模态。

  5. RESEARCH · CL_82100 ·

    ParaBridge 方法改进了语音模型的副语言理解能力

    研究人员开发了 ParaBridge,一种新颖的 on-policy 自蒸馏方法,旨在提高语音语言模型将副语言线索纳入对话的能力。该技术训练模型更好地利用非词汇信息,如语气或背景噪音,以生成更恰当的响应。ParaBridge 在 VoxSafeBench 和 EchoMind 等基准测试中显著提高了性能,同时保持了通用的语言能力。

  6. RESEARCH · CL_06671 ·

    HeadRouter 通过路由注意力头来修剪 LLM 中的音频令牌

    研究人员推出了一种名为 HeadRouter 的新方法,通过动态修剪音频令牌来压缩大型音频语言模型。与先前假设头重要性均一的方法不同,HeadRouter 认识到这些模型中的不同注意力头根据音频任务具有不同的贡献。这种无需训练的技术可以识别并利用特定注意力头的重要性来保留关键令牌,从而在不牺牲性能的情况下实现显著压缩。实验表明,HeadRouter 实现了最先进的压缩效果,在保留大量令牌的情况下,甚至在 AudioMarathon 和…