PulseAugur
中
实时 13:54:38
实体 Museum of Modern and Contemporary Art

Museum of Modern and Contemporary Art

PulseAugur coverage of Museum of Modern and Contemporary Art — every cluster mentioning Museum of Modern and Contemporary Art across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_284716 ·

    SkillFormer 使用技能适配器来适应音频语言模型

    研究人员开发了 SkillFormer,这是一种用于适应音频语言模型以完成各种任务的新方法。该方法将音频理解分解为特定技能的适配器,这些适配器在推理时通过学习到的路由器进行组合。这种技术可以防止在联合训练期间可能出现的不同技能(如音高比较和说话人计数)之间的干扰。SkillFormer 为基础模型增加了最少的参数,并在多个基准测试中显示出显著的准确性提升。

  2. TOOL · CL_284692 ·

    AdaLoop 通过自适应推理增强音频语言模型

    研究人员开发了 AdaLoop,这是一个旨在增强大型音频语言模型推理能力的新型模块。该模块自适应地确定音频相关查询所需的计算深度,对复杂的声学分析任务应用更多的迭代细化。AdaLoop 可与现有音频模型无缝集成,仅增加少量参数即可显著提高 MMSU、MMAU-Pro 和 MMAR 等基准的准确性。

  3. TOOL · CL_210497 ·

    新型LALM模型通过无指令对齐实现具有竞争力的多模态性能

    研究人员开发了一种新颖的多模态大语言模型(MLLM)创建方法,该方法仅关注对齐,绕过了传统的多阶段流程。这种新方法称为LALM,仅训练一个轻量级投影仪,同时保持音频编码器和核心LLM的冻结状态。通过利用自生成数据和无指令训练,LALM在各种基准测试中取得了具有竞争力的性能,使用的数据量大大减少,却能媲美甚至超越经过大量后训练的模型。该技术保留了LLM固有的指令遵循能力,并允许快速适应新的LLM代和模态。

  4. TOOL · CL_56435 ·

    新基准揭示音频LLM在副语言理解方面存在困难

    研究人员开发了VoxParadox,一个旨在测试音频大型语言模型(Audio LLM)副语言理解能力的新基准。该基准包含2000个合成示例,故意将语音内容与说话风格进行不匹配,以评估这些模型在辨别语气和情感等细微差别方面的能力。评估显示,当前的音频LLM常常优先考虑文本信息而非声学线索,导致在理解副语言方面出现重大失误。为解决此问题,研究团队提出了提示条件层混合器(PCLM)和直接偏好优化(DPO),这些方法显著提高了在副语言任务上的性能。