Multimodal LLMs
PulseAugur coverage of Multimodal LLMs — every cluster mentioning Multimodal LLMs across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法可对多模态大语言模型进行序数任务对齐
研究人员发现,多模态大语言模型(MLLMs)在处理序数回归任务(如年龄估计或图像质量评估)时存在显著差距。尽管内部模型状态与有序标签显示出很强的相关性,但最终的 token 输出未能反映这种序数证据。为解决此问题,开发了一种名为序数镜头对齐(Ordinal Lens Alignment, OLA)的新方法。OLA 使用在解码器层上训练的轻量级镜头来融合序数信息,并在生成过程中纠正最终的 token logit,其性能优于现有方法,同时…
-
新的基准和架构推动了 MLLMs 中的长视频理解
研究人员正在开发新的方法来改进多模态大语言模型 (MLLMs) 理解长视频的方式。一种方法 MoTE 使用任务专家混合 (Mixture of Task Experts) 将计算路由到特定任务模块,从而提高视频语言任务的准确性和效率。另一个重点是优化模型如何从长视频中提取相关信息,例如 VideoHarness-RSI 通过递归搜索有效的上下文构建程序,以及 TRACE 专注于证据支持的答案。此外,还推出了 Video-IFBench…
-
新型 AI 模型实现 LLM 的高效自注视视频分析
研究人员开发了 EgoGazeLite,这是一种轻量级的设备上注视预测模型,旨在提高多模态大型语言模型 (MLLM) 在处理自注视视频输入时的效率。该模型通过预测注视点来裁剪相关区域,从而减少所需视觉 Token 的数量,以降低高分辨率视频相关的计算和内存成本。与依赖专用眼动追踪硬件的先前方法不同,EgoGazeLite 作为一种纯软件解决方案运行,适用于消费级智能眼镜和智能手机。该模型在多个 MLLM 和指标上的性能已得到验证,在描…
-
新的MCIF基准测试了多模态和跨语言LLM的指令遵循能力
研究人员推出了MCIF,这是一个旨在评估大型语言模型多模态和跨语言指令遵循能力的新基准测试。该基准测试的独特性在于其使用科学讲座作为源材料,并全面覆盖了多种语言、模态(语音、视觉、文本)以及包括识别、翻译、问答和摘要在内的任务类型。使用MCIF对23个模型的初步分析揭示了普遍存在的挑战,并突出了多模态LLM未来发展的方向。
-
新的RIG-RoPE方法增强了多模态LLM的位置编码
研究人员推出了一种新颖的旋转位置编码方法RIG-RoPE,旨在改进大型语言模型中多模态数据的处理。该新方法解决了现有技术中的局限性,例如交错上下文中的静态位置分配以及将时间坐标视为等步计数器的问题。RIG-RoPE结合了模态指示符、视觉实例标识符和持续时间感知的时间坐标,能够实现更精确的H/W旋转和时间相位推进,尤其适用于文本、图像和视频片段。
-
DisasterTD框架使用MLLMs和跨视图图像进行灾难地理定位
研究人员开发了DisasterTD,一个旨在提高灾难期间社交媒体信息地理定位准确性的框架。该系统结合了多模态大语言模型(MLLMs)的语义推理能力和跨视图地理定位技术。通过分析社交媒体的图像和文本,DisasterTD可以识别和消歧地名,然后使用卫星和街景图像验证这些位置。该框架在准确性方面表现出显著的提高,尤其是在模糊的地名方面,减少了地理定位错误,并增强了其在应急响应中的实用性。
-
研究发现多模态大语言模型在音乐器关联中延续性别偏见
一项发表在arXiv上的新研究通过检查多模态大语言模型(LLMs)与音乐器的关联,调查了其中的性别偏见。研究人员开发了Symphony-Bias数据集,该数据集包含22种乐器的文本、视觉和音频模态,并测试了十种不同的LLM。研究结果表明,92%的模型关联与现有的关于性别化乐器的社会科学研究一致,其中竖琴和鼓在所有模态中表现出特别一致的偏见。研究还观察到,性别偏见在音频中最为微弱,在视觉中较强,在文本中最为明显。
-
AI在理解多模态幽默方面面临挑战,新调查揭示
一篇新调查论文探讨了人工智能系统理解和生成多模态幽默的挑战与方法,特别是在表情包和漫画等视觉格式方面。该研究按识别、解释和生成等能力对现有工作进行了分类,并强调了从专用模型转向大型多模态模型的趋势。论文指出了进展的关键障碍,包括评估局限性、不足的文化知识、薄弱的证据基础以及未解决的安全问题。
-
新的大语言模型研究涵盖多模态对齐、推理审计和能源使用 · 已追踪 10 个来源
近期研究探讨了大语言模型(LLM)能力和局限性的各个方面。一项研究调查了多模态大语言模型的对齐问题,提出了一种新的数据生成方法来提高图像-文本一致性。另一篇论文介绍了一种用于评估大语言模型推理的协议级审计,突出了基准分数与实际行为属性之间的差异。进一步的研究利用围棋死活题探究了大语言模型的推理效率,揭示了当前模型在搜索组织方面存在困难。此外,还有研究考察了大语言模型的能耗、默认设置和代币定价对推理服务的影响,以及低资源编程语言基准的开发。
-
新的“MentalThink”范式使用SVG进行LLM视觉推理
研究人员推出了一种新范式MentalThink,通过生成和解释可缩放矢量图形(SVG)代码,增强了多模态大型语言模型(MLLMs)的视觉符号推理能力。这种“用SVG思考”的流程允许模型创建、渲染和分析结构化矢量草图,作为多轮推理的中间视觉表示。该方法在空间理解和推理基准测试中表现出色,表明可执行矢量图形可以为复杂的认知任务提供可验证的视觉工作空间。
-
新的MARS方法利用文本拒绝指令增强多模态LLM安全性
研究人员开发了一种名为MARS(Modality-Agnostic Refusal Steering,跨模态无关拒绝引导)的新方法,以增强多模态大语言模型(MLLMs)的安全性。MARS利用通常用于单模态LLM的文本拒绝指令,在无需不安全的多模态训练数据的情况下提高安全性。该方法解决了跨模态对齐问题,并在保持效用的同时,在各种基准测试中持续展示了安全性的提升。
-
新的可控视觉表示允许对图像特征进行自然语言引导
研究人员引入了一类新的视觉表示,称为可控视觉表示(Steerable Visual Representations),旨在允许对图像特征进行自然语言引导。与现有关注显著线索或在以语言为中心的输出方面效果不佳的方法不同,该方法通过交叉注意力(cross-attention)的早期融合,将文本直接注入视觉编码器层。这使得表示能够关注图像中的任何所需对象,同时保持底层质量,在异常检测和个性化对象判别等任务上表现强劲。
-
新框架提升大语言模型图表数据提取准确性
研究人员开发了一个新的基准和训练框架,以提高多模态大语言模型(MLLMs)从图表图像中提取数据的能力。虽然当前的多模态大语言模型可以准确地从图表中重建表格结构,但它们在精确恢复数值方面常常遇到困难,尤其是在缺少标签的情况下。该框架受到人类逐步学习阅读图表方式的启发,显著提高了数值准确性,在一个拥有70亿参数的模型上达到了最先进的性能,并支持更可靠的混合式数据提取工作流程。
-
多模态大模型通过多样化数据类型增强理解能力
多模态应用是处理和生成文本、图像、音频等多种数据类型的系统,使大模型能够更像人类一样理解世界。Conceptual Captions和Visual Genome等数据集对于训练这些模型至关重要。关键概念包括模态对齐(使用注意力机制和跨模态融合等技术创建共享表示)以及跨模态学习(在不同模态之间迁移知识)。这些应用在图像字幕生成、视觉问答以及更直观的人机交互等方面具有实际用途。
-
新的ART技术通过优化视觉输入来微调多模态大语言模型
研究人员开发了一种新的参数高效微调技术,用于多模态大语言模型,称为ART(基于艺术的强化训练)。与修改计算图的现有方法不同,ART仅优化冻结模型的原始视觉输入。这种方法允许在预编译的高吞吐量引擎上进行微调,并将优化后的视觉输入风格化为计算艺术品。ART在数学和结构化工具使用基准测试中已显示出与LoRA相当的准确性,证实了其在各种Qwen模型尺寸上的有效性。
-
AI模型在科学声明验证中未能路由图表数据
研究人员已经发现了多模态大语言模型在验证图表中呈现的科学声明时,为何不如表格那样有效。通过对三个开源VLMs进行逐层线性探测和注意力分析,他们发现图表中的信息被编码在模型的中间表示中,但未能到达预测层。这种与表格情况不同的断开表明,问题不在于编码视觉数据,而在于有效地将其路由以进行预测。
-
语言模型增强深度伪造检测器的泛化能力和可解释性
研究人员开发了一种新颖的方法,通过利用多模态大型语言模型(MLLMs)来训练深度伪造检测器。该方法使用语言作为正则化机制,以提高检测器的泛化能力和可解释性。该系统采用双编码器架构和两阶段训练过程,包括强化学习以鼓励分类前的描述性推理,从而显著提高性能并提供可解释的输出。
-
多模态 LLM 通过新的时序、数据和视觉技术取得进展
研究人员正在开发能够处理和整合文本、音频和视频等各种数据类型的多模态大型语言模型(MLLM)。一种名为 MM-When2Speak 的方法侧重于通过预测何时应进行简短反应或完整回应来改进对话时序,性能提升三倍。其他研究则探索仅使用成对模态来训练 MLLM,以减少数据整理工作量,并通过自我蒸馏技术解决细粒度视觉理解的挑战。这些进展旨在创建更自然、更具吸引力、更强大的 AI 系统,使其能够更好地感知和与现实世界互动。
-
新数据集针对耸人听闻图像检测以进行虚假信息分析
研究人员推出了 Sens-VisualNews,这是一个新基准数据集,用于检测图像中的耸人听闻内容。该数据集包含来自新闻报道的 9,500 多张图像,并针对各种耸人听闻的概念进行了标注。该资源旨在推进对识别可能绕过批判性评估并加速病毒式传播的令人震惊或情绪化的视觉内容的研究,可能有助于检测虚假信息。
-
LLM大脑对齐随训练数据和任务特异性而变化
研究人员正在探索大型语言模型(LLM)如何在不同语言和任务中与人类大脑活动对齐。研究表明,LLM的中间层最能预测大脑反应,并且这种对齐受训练数据语言主导地位的影响,而非模型本身的类型。此外,经过指令微调的多模态LLM表现出更强的大脑对齐能力,尤其是在围绕特定任务需求而非仅仅表面语义进行组织时。