OmniLLMs
PulseAugur coverage of OmniLLMs — every cluster mentioning OmniLLMs across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的OmniConfess方法解决了多模态AI幻觉问题
研究人员开发了OmniConfess,一种新颖的无需训练的方法,旨在减少全模态大语言模型(OmniLLMs)中的幻觉。这些模型处理文本、图像、音频和视频,在依赖错误证据时经常生成不正确的信息。OmniConfess通过在Token级别分析候选响应,识别其对不同证据通道的依赖性,并利用这种“供述”来纠正基于相关内容并解决基于不相关或矛盾数据所做的承诺。为了评估其有效性,创建了一个名为OmniHalluBench的新基准,包含跨越多种模态…
-
新框架在无真实标签情况下使 OmniLLMs 适应压缩上下文
研究人员开发了一种名为 CAFD(Compressed-Context Adaptation via Full-Context Distillation,通过全上下文蒸馏实现压缩上下文适应)的新型自蒸馏框架,以提高全模态大语言模型 (OmniLLMs) 的性能。该方法使 OmniLLMs 能够在不需要真实标签或奖励的情况下适应压缩的多模态令牌序列。通过将样本的全上下文视图作为特权信息,CAFD 使用全上下文自教师的软目标来训练压缩上下…
-
新的TraceAV-Bench凸显OmniLLM在长时音视频推理方面的挣扎
一项新的基准测试TraceAV-Bench已被推出,用于评估OmniLLMs在长时音视频上的多跳推理能力。该基准测试包含578个视频中的2200个问题,总时长超过339小时,并评估了多模态幻觉鲁棒性。包括Gemini 3.1 Pro和Ming-Flash-Omni-2.0在内的当前领先模型显示出显著的局限性,表现最好的模型准确率仅为68.29%,表明在长时音视频推理方面存在巨大差距。
-
新方法大幅削减OmniLLM Token成本,提高效率和准确性 · 跟踪9个来源
研究人员开发了多种新颖的方法来压缩全模态大语言模型(OmniLLMs)中的Token序列,以降低内存和推理成本。这些方法,包括OmniDelta、OmniScope、Progressive Cramming、PCA和ReMo,专注于在音频、视频和文本等模态之间智能地分配和修剪Token。通过解耦模态相关性、利用查询相似性以及识别冗余或分布外Token,这些技术旨在在显著降低计算开销的同时,维持甚至提高准确性。实验表明,GPU内存大幅减…
-
新方法解决全模态LLM的令牌压缩问题以提高效率
两篇新的研究论文提出了压缩全模态大语言模型(OmniLLMs)令牌序列的方法,以降低推理成本。第一篇论文DASH,使用音频线索动态分割序列,并采用三信号估计器保留重要令牌,在AVUT和VideoMME等基准测试中实现了更高的压缩率和有竞争力的准确性。第二篇论文OmniFocus,采用查询引导式方法,独立估计视频和音频令牌的重要性,旨在减轻模态偏差并保持一致性。OmniFocus在Qwen2.5-Omni模型系列上展示了强大的性能,在准…
-
OmniSelect 框架提升全模态大语言模型效率
研究人员推出 OmniSelect,一个旨在提高全模态大语言模型 (OmniLLMs) 效率的新框架。这种无需训练的方法根据音频和视频等不同模态与给定查询的相关性,动态调整令牌压缩策略。通过采用轻量级的 AudioCLIP 模型,OmniSelect 对输入进行分类并选择性地修剪令牌,在无需额外训练的情况下保留关键信息。