PulseAugur
中
实时 18:47:18
实体 multimodal large language model

multimodal large language model

PulseAugur coverage of multimodal large language model — every cluster mentioning multimodal large language model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
165
90 天内 165
发布 · 30天
0
90 天内 0
论文 · 30天
163
90 天内 163
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/9 页 · 共 175 条
  1. TOOL · CL_284851 ·

    新的RSJEV框架使用MLLMs进行高效遥感场景分类

    研究人员推出了一种新颖的遥感场景分类框架RSJEV,该框架利用了多模态大语言模型(MLLMs)。与生成文本的传统MLLMs不同,RSJEV将分类重新构建为判别式决策过程,直接估计类别概率而无需自回归解码。该方法在UC Merced和AID等基准测试中进行了测试,与现有的基于CNN、Transformer、Mamba和CLIP的方法相比,性能有所提高,并且由于模型更小,推理成本也有所降低。

  2. TOOL · CL_284704 ·

    MLLMs 在零样本地理定位和语言推理方面展现出潜力

    研究人员探索了使用多模态大语言模型 (MLLMs) 进行跨视图地理定位的零样本语言推理。研究发现,虽然 MLLMs 可以为地面图像和卫星图块生成描述性文本,但仅凭这些描述不足以在未经训练的情况下进行准确的定位。然而,当搜索范围缩小后,MLLM 生成的描述可以提高定位准确性并为匹配提供可解释的证据,尽管与经过训练的视觉检索器相比,它们在细微的外观细节方面存在困难。

  3. TOOL · CL_280533 ·

    新的TerraVis框架评估AI图像生成中的世界一致性

    研究人员推出TerraVis,一个旨在评估生成图像与现实世界物理和空间关系一致性的新框架。该框架解决了现有指标的局限性,这些指标常常忽略诸如物体畸形或不合乎情理的交互等问题。TerraVis利用多模态大语言模型(MLLM)来评估图像的合格性,然后识别并量化18种世界一致性违规行为,将其分为轻微或严重两类,以产生一个总体分数。实验表明,TerraVis与人类判断高度相关,并揭示了在其他指标上表现优异的模型仍然可能出现严重的世界一致性故障。

  4. TOOL · CL_275453 ·

    新基准揭示多模态大语言模型在图像编辑评判中的偏见

    研究人员开发了一个名为 EditJudgeBias 的新基准,用于审计多模态大语言模型(MLLM)在用作图像编辑任务裁判时的偏见。该基准包含 1,196 个真实编辑样本和 13 个旨在测试质量保留干预措施的注入线索。实验显示,MLLM 裁判容易受到无关视觉线索的影响,捏造的多数意见会提高评分,而候选顺序的改变会逆转相当一部分的决策。研究强调,需要不同的指标来表征 MLLM 裁判的鲁棒性,因为单一指标无法捕捉其性能的所有方面。

  5. TOOL · CL_273600 ·

    MiCo方法通过减少视觉标记来优化MLLM推理

    研究人员开发了MiCo,一种新颖的无需训练的方法,通过减少处理的视觉标记数量来优化多模态大语言模型(MLLM)的推理。MiCo采用两阶段剪枝方法,基于语义擦除建模和任务感知子集选择来选择代表性的视觉标记。该方法在各种MLLM和基准测试中始终优于现有技术,在保持高性能的同时显著提高了推理速度。例如,MiCo将LLaVA-NEXT-13B的视觉标记减少到5.6%,实现了3.8倍的加速,而性能仅下降2.5%。

  6. TOOL · CL_273498 ·

    新的ATAR框架使用取证工具进行可解释的图像篡改检测

    研究人员开发了一个名为Agentic Tool-Augmented Reasoning (ATAR) 的新框架,用于检测和解释图像篡改。ATAR集成了七个领域的22个专业取证工具,能够自主推理并识别被篡改的图像。该系统采用了一种双流法证推理范式,结合了语义异常检测和从取证工具中提取客观证据。实验表明,ATAR在篡改检测和提供更具依据的解释方面,显著优于现有的多模态大语言模型(MLLM)方法。

  7. TOOL · CL_273333 ·

    LLM驱动的框架实现了自适应激光雷达攻击

    研究人员开发了TACTIC,一个利用多模态大语言模型(MLLM)执行自适应路侧激光雷达攻击的新型框架。该系统使用本地感知数据和路侧图像构建语义场景图,使其能够选择和配置诸如“推开”和“幻影障碍刹车”之类的攻击原语。在CARLA模拟中,TACTIC实现了100%的碰撞率,显著优于固定或随机选择的攻击策略,并通过异步重新规划提高了响应时间。

  8. TOOL · CL_270357 ·

    新框架 VMIR-CVI 推进零样本组合图像检索

    研究人员推出 VMIR-CVI,一个旨在增强零样本组合图像检索的新颖框架。该方法通过将复杂查询转换为与视觉语言模型 (VLP) 空间对齐的统一文本描述来优化多模态意图表示。此外,它使用解耦的视觉实例线索来重建查询表示,以最小化噪声并保留目标相关信息。在 CIRR、CIRCO 和 FashionIQ 基准上的实验表明,VMIR-CVI 超越了现有方法,并建立了新的最先进性能。

  9. TOOL · CL_259236 ·

    新的MIRAGE研究揭示了多模态代理证据使用的缺陷

    一项题为MIRAGE的新研究介绍了一个用于多模态大型语言模型(MLLM)代理的受控评估框架,重点关注它们在对话中检索和利用历史证据的能力。研究揭示了基于对话状态的证据使用的不同失败模式,特别指出开放权重模型在来源受损时难以处理上下文连续性和通过工具进行的检索。研究结果表明,当前的仅结果评估可能高估了代理的能力,需要一种考虑状态变化的更细致的方法。

  10. TOOL · CL_261214 ·

    新的强化学习方法用更少的 token 提升多模态大语言模型的视觉感知能力

    研究人员开发了一种新颖的强化学习方法 Vision-RL2,用于增强多模态大语言模型(MLLMs)的细粒度视觉感知能力。该方法通过将连贯的图像区域视为动作,并根据其对多模态大语言模型答案可能性的影响进行评分,来优化区域提议网络。Vision-RL2 在各种基准测试和多模态大语言模型骨干网络上显著提高了准确性,同时大幅减少了所需的视觉 token 数量,从而降低了计算成本。

  11. TOOL · CL_254977 ·

    新型神经符号系统MedVA改进医学体积可视化

    研究人员开发了MedVA,一种新颖的神经符号代理系统,旨在增强医学体积可视化。该系统通过整合三个专业代理来解决当前工作流程的局限性:一个通过符号推理精炼自然语言请求,另一个使用多个大规模分割模型识别感兴趣区域,第三个根据客观评估优化可视化。跨不同医学数据集的评估和用户研究表明,MedVA对不同专业水平的用户都具有有效性和实用价值。

  12. TOOL · CL_254879 ·

    DiVA 模拟器通过视频模型实现交互式数字生命模拟

    研究人员推出 DiVA,这是一种新颖的数字生命模拟器,专为长期、开放式交互体验而设计。DiVA 利用多模态大型语言模型 (MLLM) 作为路由器,并结合专门的堆叠视频管道,实现无缝的多轮交互。该系统采用锚定视频续接 (AVC) 模块来管理视频片段之间的过渡,确保连续性并减少视觉退化,从而实现复杂姿势变化以及高保真度的身份和连贯性。

  13. RESEARCH · CL_254248 ·

    新方法增强MLLM对长视频的理解能力 · 跟踪2个来源

    两篇新研究论文解决了使多模态大语言模型(MLLM)能够理解长视频的挑战,目前这受到令牌和计算预算的限制。第一篇论文《面向长视频理解的MLLM-agnostic即插即用关键帧选择方法的评估》对现有的无训练关键帧选择方法进行了全面评估,发现QAaF通常表现最佳。第二篇论文介绍了MarKey,一个新颖的无训练框架,它通过考虑查询相关性、边际覆盖增益和上下文相关冗余来使用贪婪优化方法选择关键帧,在多个基准和MLLM骨干网络上均表现出卓越的性能。

  14. RESEARCH · CL_252267 ·

    新方法应对AI模型测试时适应挑战 · 跟踪2个来源

    研究人员开发了机器学习模型测试时适应的新方法。第一种方法MASA使用多模态大型语言模型来锚定语义描述,有助于打破模型在适应不断变化的数据分布时出现的自我参照错误循环。第二种方法TestDG侧重于持续测试时适应,旨在使模型能够泛化到未来未见的领域,同时保留先前领域的知识。两种方法在相关基准测试中均显示出有希望的结果。

  15. TOOL · CL_252149 ·

    新框架 STAG 解释音频 MLLM 的推理过程

    研究人员开发了 STAG,一个新颖的事后框架,旨在解释基于音频的多模态大语言模型(MLLM)的推理过程。该系统提供令牌级频谱时域对齐,识别输入音频信号的具体哪些部分对每个生成的文本令牌做出了贡献。STAG 在多个基准测试中实现了卓越的事件定位性能,并且无需参数更新即可成功应用于各种音频-语言模型。

  16. TOOL · CL_247918 ·

    新框架支持在边缘设备上高效理解长视频

    研究人员开发了一个名为 Caption-once, Frames-on-Demand (CFD) 的新框架,旨在实现边缘设备上高效的长视频理解。该系统利用双轨道叙事索引,结合事件级故事骨架和剪辑级微日志,以减少重新字幕的需求。云端多模态大语言模型 (MLLM) 然后使用视觉需求路由器 (Visual-Need Router) 为感知查询选择性地检索关键帧,同时将时间结构问题保留在语言域内,从而优化计算和带宽使用。

  17. TOOL · CL_245602 ·

    研究发现MC-VQA基准测试在LLM评估中存在缺陷

    arXiv上发表的一项新研究揭示了常用于评估多模态大语言模型(MLLMs)的多项选择视觉问答(MC-VQA)基准测试中存在的重大缺陷。研究人员发现,在这些基准测试上的表现高度依赖于提示格式中细微的、语义中性的变化,例如选项ID集、分隔符和分割符。这些格式变化可能导致模型性能排名反转,表明MC-VQA可能无法可靠地衡量多模态推理能力。研究表明,当前的MC-VQA评估未能充分控制提示格式敏感性,导致基准测试不可靠,并促使开发新的评估协议。

  18. TOOL · CL_245039 ·

    新型AI代理可将蓝图准确转换为模拟模型

    研究人员开发了BlueprintAgent (BPA),这是一种新颖的多模态代理,旨在将扫描的结构蓝图准确转换为可模拟模型。与依赖直接提示或固定管道的先前方法不同,BPA使用多模态大型语言模型 (MLLM) 作为其主要读取器,并辅以OCR和计算机视觉。该代理的关键创新在于其约束触发机制,该机制利用工程约束来启动MLLM对蓝图特定区域的定向重访,确保输出符合关键工程要求。BPA在真实蓝图数据上取得了卓越的性能,宏平均Beam F1得分达…

  19. TOOL · CL_235430 ·

    新型AI智能体StrixAE通过多模态LLM增强音频

    研究人员开发了StrixAE,这是一种用于复杂真实场景音频增强的智能体。StrixAE利用多模态大语言模型(MLLM)来管理各种音频增强和个性化模型。该智能体经过两阶段训练过程,包括在AcoustBench上的监督微调和音频感知强化学习(APRL),以提高其推理、工具调用和泛化能力。该方法旨在减少伪影并提高感知质量,在真实测试数据集上表现优于现有解决方案。

  20. RESEARCH · CL_233600 ·

    AI图像取证研究推动检测和定位技术发展

    两篇提交至arXiv的研究论文提出了检测和定位被操纵图像(尤其是AI生成图像)的先进方法。第一篇论文介绍了一个用于GenText-Forensics挑战的证据引导系统,该系统结合了图像级检测器、空间定位器和多模态大语言模型来生成取证报告。该系统在该挑战中获得第二名。第二篇论文提出了一个统一框架,该框架超越了简单的检测,包括对篡改区域的像素级定位,在分类准确性和定位方面均优于现有基准。