Qwen2.5-Omni-3B
PulseAugur coverage of Qwen2.5-Omni-3B — every cluster mentioning Qwen2.5-Omni-3B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的WnW KV缓存方法优化了长篇语音大语言模型
研究人员开发了一种名为增减KV缓存(WnW)的新颖方法,以优化用于长篇语音处理的大语言模型的内存使用。该技术将KV缓存头分为锚点、潮汐和固定角色,允许锚点头保留在GPU上以进行实时重要性监控。潮汐头利用CPU驻留存储,并根据锚点头分数选择性地调用,而固定头则保留较小的GPU子集。在3B参数模型上使用LibriSpeech-Long数据集进行的实验表明,WnW在仅使用音频令牌通常所需的GPU内存的20%的情况下,保持了接近全缓存的准确性…
-
新的 A-PACK 框架通过延迟音频剪枝大幅降低全模态大语言模型的成本
研究人员推出了一种新颖的两阶段框架 A-PACK,旨在降低全模态大语言模型(omni-LLM)相关的计算成本。该方法将音频剪枝推迟到查询条件下的多模态交互变得相关时进行,解决了处理长多模态序列的显著预填充和 KV 缓存费用问题。A-PACK 优先考虑音频信息密度,并利用局部视听动态进行更有效的视觉选择,从而在 Qwen2.5-Omni 模型上的基准测试中大幅减少计算操作并提高解码吞吐量。
-
Gemma 4 E2B 在工业边缘 AI 模型测试中领先于更快的竞争对手
最近在 Jetson 设备上对五个小型多模态模型进行的工业边缘 AI 运行时测试发现,尽管 Gemma 4 E2B 不是最快的,但它仍然是基准模型。SmolVLM2 是最快的,但其输出过于泛泛。Qwen2.5-VL 表现强劲,尤其是在 OCR 和视觉检查任务中,使其成为一个有力的竞争者。InternVL3 在较高设置下存在上下文错误和延迟问题,而 Qwen2.5-Omni 更适合未来的音频/视频工作流。选择标准强调本地部署、结构化输出…
-
新框架和基准推动视频大模型效率和理解能力发展
研究人员推出了一种名为EarlyTom的新框架,旨在通过在视觉编码器早期压缩视觉令牌来提高视频大语言模型(Video-LLMs)的效率。该方法在不牺牲准确性的前提下,显著降低了首个令牌生成时间(TTFT)和计算成本。同时,OmniPro和VideoOdyssey等新基准正在开发中,用于评估全模态模型在理解流式和长上下文视频数据方面的先进能力,以解决现有评估方法的局限性。
-
HeadRouter 通过路由注意力头来修剪 LLM 中的音频令牌
研究人员推出了一种名为 HeadRouter 的新方法,通过动态修剪音频令牌来压缩大型音频语言模型。与先前假设头重要性均一的方法不同,HeadRouter 认识到这些模型中的不同注意力头根据音频任务具有不同的贡献。这种无需训练的技术可以识别并利用特定注意力头的重要性来保留关键令牌,从而在不牺牲性能的情况下实现显著压缩。实验表明,HeadRouter 实现了最先进的压缩效果,在保留大量令牌的情况下,甚至在 AudioMarathon 和…