PulseAugur
实时 08:40:29
实体 Qwen2.5-Omni-7B

Qwen2.5-Omni-7B

PulseAugur coverage of Qwen2.5-Omni-7B — every cluster mentioning Qwen2.5-Omni-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_208498 ·

    多模态AI模型展示了处理语音和面部情感的共享机制

    研究人员调查了多模态基础模型(MFMs)如何处理来自语音和面部表情的情感。通过检查Gemma-4-12B-it、MiniCPM-o-4.5和Qwen2.5-Omni-7B等模型中的特定神经元,他们识别出了对识别情感线索至关重要的情感敏感神经元(ESNs)。研究发现,这些ESNs在情感识别中起着因果作用,并且可以通过操纵它们的激活来增强或削弱对特定情感的识别。此外,研究表明这些模型在听觉和视觉模态中表示情感的方式存在部分重叠和结构对齐,…

  2. TOOL · CL_198317 ·

    Qwen-MusicAVQA-7B模型以高效设计增强音乐视听问答能力

    研究人员开发了Qwen-MusicAVQA-7B,一个专为音乐视听问答设计的​​多模态模型。该模型使用学习到的线性投影,有效地将一个冻结的Whisper音频编码器与Qwen2-VL-7B-Instruct语言模型连接起来。该系统在MUSIC-AVQA基准测试中表现强劲,准确率达到96.0%,并强调了在有效的视听问答中保留音频表示中细粒度时间信息的重要性。

  3. TOOL · CL_193354 ·

    新的 A-PACK 框架通过延迟音频剪枝大幅降低全模态大语言模型的成本

    研究人员推出了一种新颖的两阶段框架 A-PACK,旨在降低全模态大语言模型(omni-LLM)相关的计算成本。该方法将音频剪枝推迟到查询条件下的多模态交互变得相关时进行,解决了处理长多模态序列的显著预填充和 KV 缓存费用问题。A-PACK 优先考虑音频信息密度,并利用局部视听动态进行更有效的视觉选择,从而在 Qwen2.5-Omni 模型上的基准测试中大幅减少计算操作并提高解码吞吐量。

  4. RESEARCH · CL_158603 ·

    Audio-Zero 框架在无标签情况下增强了 LLM 的音频推理能力

    研究人员开发了 Audio-Zero,一个旨在增强大型音频语言模型 (LALM) 细粒度音频推理能力的新框架。该方法采用无标签自演化方法,创建了一个自玩游戏,模型生成音频片段的描述并识别细微差别。这个过程使模型能够在无需昂贵的外部标签的情况下提高其听觉感知和推理能力。实验表明,Audio-Zero 在保持更广泛理解能力的同时,能有效提升细粒度音频理解能力,演化分析显示出现了更详细的听觉描述。

  5. RESEARCH · CL_160839 ·

    新方法大幅削减OmniLLM Token成本,提高效率和准确性 · 跟踪9个来源

    研究人员开发了多种新颖的方法来压缩全模态大语言模型(OmniLLMs)中的Token序列,以降低内存和推理成本。这些方法,包括OmniDelta、OmniScope、Progressive Cramming、PCA和ReMo,专注于在音频、视频和文本等模态之间智能地分配和修剪Token。通过解耦模态相关性、利用查询相似性以及识别冗余或分布外Token,这些技术旨在在显著降低计算开销的同时,维持甚至提高准确性。实验表明,GPU内存大幅减…

  6. RESEARCH · CL_128785 ·

    新方法解决全模态LLM的令牌压缩问题以提高效率

    两篇新的研究论文提出了压缩全模态大语言模型(OmniLLMs)令牌序列的方法,以降低推理成本。第一篇论文DASH,使用音频线索动态分割序列,并采用三信号估计器保留重要令牌,在AVUT和VideoMME等基准测试中实现了更高的压缩率和有竞争力的准确性。第二篇论文OmniFocus,采用查询引导式方法,独立估计视频和音频令牌的重要性,旨在减轻模态偏差并保持一致性。OmniFocus在Qwen2.5-Omni模型系列上展示了强大的性能,在准…

  7. TOOL · CL_98002 ·

    新的CoAT框架通过连续思考空间增强大型音频语言模型

    研究人员开发了一个名为连续音频思考(CoAT)的新框架,旨在增强大型音频语言模型(LALMs)的能力。CoAT为这些模型配备了一个连续的潜在工作空间,用于在生成响应之前组织声学信息,使它们能够更好地利用语音细节、韵律和其他声学元素。这种方法不会增加自回归解码的成本,并且在与Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo等模型进行测试时,在各种音频理解和推理任务中都显示出性能提升。

  8. RESEARCH · CL_90988 ·

    新的OmniVideo-100K数据集增强了AI的视听推理能力

    研究人员推出了OmniVideo-100K,这是一个旨在提高AI系统视听推理能力的新数据集。该数据集通过使用一个自动化引擎从视频创建结构化脚本,确保了跨片段的一致性并将音频链接到视觉来源,从而解决了当前方法的局限性。这种方法采用了实体锚定视频脚本和线索引导问答生成,在微调VITA-1.5和Qwen2.5-Omni-7B等模型时取得了显著的性能提升。

  9. RESEARCH · CL_06671 ·

    HeadRouter 通过路由注意力头来修剪 LLM 中的音频令牌

    研究人员推出了一种名为 HeadRouter 的新方法,通过动态修剪音频令牌来压缩大型音频语言模型。与先前假设头重要性均一的方法不同,HeadRouter 认识到这些模型中的不同注意力头根据音频任务具有不同的贡献。这种无需训练的技术可以识别并利用特定注意力头的重要性来保留关键令牌,从而在不牺牲性能的情况下实现显著压缩。实验表明,HeadRouter 实现了最先进的压缩效果,在保留大量令牌的情况下,甚至在 AudioMarathon 和…