PulseAugur
实时 08:16:36
实体 Omni-LLMs

Omni-LLMs

PulseAugur coverage of Omni-LLMs — every cluster mentioning Omni-LLMs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_216198 ·

    新的OmniAssistBench基准揭示全模态大语言模型在实时视频辅助方面存在困难

    一个新的基准OmniAssistBench已被开发出来,用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手的性能。该基准通过逆向工程互联网视频构建而成,揭示出当前模型在视觉提示、多轮交互中保持上下文以及及时响应方面存在困难。在评估中,Google的Gemini 3-Pro得分66.4,而开源的Qwen3-Omni-Instruct得分51.2,这表明在这些模型能够可靠地作为交互式助手运行之前,仍有很大的改进空间。

  2. TOOL · CL_206347 ·

    新研究识别并提出 Omni-LLM 感知-决策不对齐问题的解决方案

    研究人员在 Omni-大型语言模型 (Omni-LLMs) 中发现了一个关键问题,称为感知-决策不对齐 (PDM)。该问题意味着,尽管模型表现强劲,但其决策并未忠实地与其多模态感知保持一致。为解决此问题,开发了一种名为因果模态敏感度 (CMS) 的新指标,使用答案保留率 (ARR) 和对数几率角差异 (LAD) 来诊断 PDM。还创建了一个新的基准数据集 CausalMSBench,以隔离语言先验并测试 CMS。研究发现,当前的 Om…

  3. TOOL · CL_193354 ·

    新的 A-PACK 框架通过延迟音频剪枝大幅降低全模态大语言模型的成本

    研究人员推出了一种新颖的两阶段框架 A-PACK,旨在降低全模态大语言模型(omni-LLM)相关的计算成本。该方法将音频剪枝推迟到查询条件下的多模态交互变得相关时进行,解决了处理长多模态序列的显著预填充和 KV 缓存费用问题。A-PACK 优先考虑音频信息密度,并利用局部视听动态进行更有效的视觉选择,从而在 Qwen2.5-Omni 模型上的基准测试中大幅减少计算操作并提高解码吞吐量。

  4. RESEARCH · CL_160839 ·

    新方法大幅削减OmniLLM Token成本,提高效率和准确性 · 跟踪9个来源

    研究人员开发了多种新颖的方法来压缩全模态大语言模型(OmniLLMs)中的Token序列,以降低内存和推理成本。这些方法,包括OmniDelta、OmniScope、Progressive Cramming、PCA和ReMo,专注于在音频、视频和文本等模态之间智能地分配和修剪Token。通过解耦模态相关性、利用查询相似性以及识别冗余或分布外Token,这些技术旨在在显著降低计算开销的同时,维持甚至提高准确性。实验表明,GPU内存大幅减…

  5. TOOL · CL_56085 ·

    新的基准和代理框架增强了 LLM 的视听推理能力

    研究人员推出了 MOV-Bench,这是一个旨在评估 Omni-LLM 多跳视听推理能力的新基准。该基准包含 519 个问题,需要对分散的音频和视觉证据进行复杂推理。为了解决当前模型的局限性,该团队还开发了 AOP-Agent,这是一个代理框架,可以在无需额外训练的情况下增强 Omni-LLM 的主动感知能力。实验表明,AOP-Agent 显著提高了推理性能,尤其是在处理更长的视频和更具挑战性的问题时。