PulseAugur
实时 04:12:30
实体 Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond

Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond

PulseAugur coverage of Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond — every cluster mentioning Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
81
90 天内 298
发布 · 30天
0
90 天内 0
论文 · 30天
81
90 天内 296
层级分布 · 90 天
主题
关系
情绪 · 30 天

24 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_217668 ·

    新框架PeFuse实现训练无关的组合图像检索

    研究人员开发了PeFuse,一个新颖的、用于组合图像检索(CIR)的训练无关框架。该方法利用预训练的Diffusion模型和多模态大语言模型,通过生成式转换来连接不同的模态。PeFuse将CIR重新表述为单一模态检索任务,无需专门训练即可在标准基准上取得有竞争力的性能。

  2. RESEARCH · CL_216170 ·

    新方法旨在改进多模态大语言模型在长视频理解方面的能力

    两篇新的研究论文提出了改进多模态大语言模型(MLLMs)长视频理解能力的新颖方法。第一篇论文介绍了Route2Look框架,该框架使用查询自适应证据获取来动态选择用于浏览、定位和检索视频内信息的工具。第二篇论文提出了片段到视频监督(S2V)方法,这是一种更有效的训练方法,它从本地化的视频片段生成问答对,以增强细粒度推理能力,而无需进行大量的强化学习。

  3. TOOL · CL_216162 ·

    新数据集AGIDefect-4K旨在分析AI生成图像的缺陷

    研究人员推出了AGIDefect-4K,一个旨在解决AI生成图像缺陷诊断这一探索不足领域的新数据集。该数据集包含来自15个不同生成模型的4000张图像,具有分层标注,包括缺陷检测标签、像素级分割掩码以及缺陷类型及其感知影响的文本解释。研究人员还开发了AGIDA,一个利用多模态大语言模型(MLLMs)进行缺陷检测、定位、解释和质量预测的基线框架,证明了理解AGI缺陷仍然是一个重大挑战。

  4. TOOL · CL_215903 ·

    新的ReFrame框架在无需重新训练的情况下增强了多模态大语言模型的安全性

    研究人员推出ReFrame,一个新颖的框架,旨在无需重新训练即可增强多模态大语言模型(MLLMs)的安全对齐。这种无需训练的方法利用两个代理来解决跨模态越狱和推理惯性等挑战。证据生成代理创建风险和效用证据,然后重写和路由代理在MLLM处理之前使用这些证据构建安全的代理提示和图像路由决策。实验表明,ReFrame能有效提高对越狱的防御能力,增强安全意识,并减少过度敏感性,同时保持多模态效用。

  5. TOOL · CL_215862 ·

    综述论文探讨多模态大语言模型在容积放射学人工智能中的应用

    一篇新发表在arXiv上的综述论文探讨了多模态大语言模型(MLLMs)在容积放射学人工智能中的集成。论文强调了表示完整的3D空间上下文和定量信息所面临的挑战,这些信息对于临床解读至关重要,但通常在依赖2D图像或文本报告的当前MLLM方法中丢失。论文提出了一个用于评估该领域声明、设计和验证的框架,强调需要原生的容积建模和主体能力来确保临床可信度。

  6. TOOL · CL_216978 ·

    Apple的IVT框架通过内部化视觉思维增强视频推理能力

    Apple机器学习研究院开发了一个名为内部化视觉思维(IVT)的新框架,以改进多模态大型语言模型的前瞻性视频推理能力。IVT在训练期间训练模型预测未来的帧表示,从而在推理时无需生成中间推理图像。与现有的视觉CoT方法相比,这种方法显著降低了计算开销和延迟,同时在视频推理任务上取得了相当或更好的性能。

  7. TOOL · CL_211990 ·

    时间序列检索提升多模态语言模型预测机械寿命的准确性

    研究人员开发了一个新框架,该框架使用时间序列检索来提高多模态大型语言模型(MLLM)预测机械剩余使用寿命(RUL)的准确性。该方法包括从训练数据集中检索历史上相似的退化片段,并将它们与测试轨迹一起呈现给MLLM。在C-MAPSS基准上的评估表明,与基线方法相比,这种基于检索的方法始终能提高RUL预测的准确性和稳定性。检索机制的有效性取决于MLLM利用检索信息的能力,这表明时间序列检索是提高实际PHM设置中预测推理能力的一项有前景的技术。

  8. TOOL · CL_208639 ·

    新的MS-MFAD系统使用MLLM实现强大的面部反欺骗检测

    研究人员开发了MS-MFAD,这是一个利用多模态大语言模型(MLLM)的新型人脸反欺骗检测系统。与传统方法不同,MS-MFAD采用细粒度的像素语义锚定机制,以确保可审计的推理并防止定位幻觉。通过标注有限数量的高质量掩码,该系统显著降低了错误率,并证明了其对抗对抗性攻击的鲁棒性,同时满足实时部署的要求。

  9. TOOL · CL_208525 ·

    新的CADP范式旨在解锁学术论文中的知识

    研究人员引入了一种名为可编译学术文档解析(CADP)的新范式,以更好地表示嵌入在学术论文中的科学知识。当前的方法在保留表格、公式和伪代码等元素的结构和逻辑方面存在困难,而这些元素对于多模态大语言模型(MLLMs)至关重要。CADP使用LaTeX和可执行Python重建这些文档,从而可以直接将重建的元素与源进行验证。一个新的基准CADP-Bench已被开发出来以评估此过程,结果显示即使是先进的MLLMs在生成高保真、可执行的重建方面仍有…

  10. TOOL · CL_208450 ·

    新的BEAR-Bench评估多模态模型处理复杂的英语和俄语文档的能力

    研究人员推出了BEAR-Bench,这是一个旨在评估多模态大语言模型(MLLMs)在处理复杂的、文本密集的英语和俄语文档时的推理能力的新基准。该基准解决了现有评估的局限性,这些评估通常侧重于简单的信息提取或严重偏向英语和中文。BEAR-Bench包含1000个源自商业和科学文本的人工标注问题,对包括Gemini-3.1 Pro和Qwen3.5-397B在内的16个MLLMs进行的初步评估显示,即使是表现最好的模型也有很大的改进空间。该…

  11. RESEARCH · CL_206682 ·

    新基准揭示多模态大语言模型在手写和视频OCR方面存在困难

    引入了两个新基准OmniHandwritingOCR和MME-VideoOCR,用于评估多模态大语言模型(MLLMs)的光学字符识别(OCR)能力。OmniHandwritingOCR侧重于真实的手写文本和数学表达式,揭示出当前模型在处理复杂公式时存在困难,并且经常出现幻觉式的修正。MME-VideoOCR在视频场景下评估MLLMs,突出了其在处理运动模糊、时间变化以及需要整体视频理解的任务方面的局限性,即使是Gemini 2.5 P…

  12. TOOL · CL_206569 ·

    New Perspective-Invariant Attack Enhances Adversarial Example Transferability

    研究人员开发了一种名为透视不变攻击(PIA)的新方法,以增强深度神经网络中对抗样本的可迁移性。与使用有限局部变换的先前方法不同,PIA采用多自由度顶点采样策略来覆盖从简单平移到复杂透视映射的透视变换层级。这种方法生成几何上多样化的变体,减少了对抗性扰动对代理模型的过拟合,并提高了跨模型的可迁移性。进一步的扩展PIA-Mix将透视变换与辅助方法相结合,以获得更大的效果,在各种网络架构和多模态大型语言模型上都优于现有的最先进攻击。

  13. TOOL · CL_206565 ·

    新的MEDR方法提高了多模态LLM视频处理效率

    研究人员开发了一种名为MEDR的新型查询无关帧选择方法,旨在提高多模态大型语言模型处理长视频时的效率。与需要为每个问题选择帧的查询相关方法不同,MEDR创建了一个固定的帧集,可跨多个查询重复使用。该方法利用多信号事件建模和动态重评分来识别超越简单均匀采样的信息帧,在Video-MME和LongVideoBench等基准测试中准确率提高了多达1.23%。

  14. TOOL · CL_206556 ·

    新框架Zero-MELO提升MLLM微手势识别能力

    研究人员开发了Zero-MELO,一个旨在提高多模态大语言模型(MLLMs)在微手势识别(MGR)方面性能的新框架。该框架通过引入一种测试时证据校准方法,解决了MLLMs在处理细粒度和以动作为中心任务方面的局限性。该方法使用树搜索机制收集局部视觉证据,并使用校准模块纠正分数偏差,与基线模型相比,在iMiGUE和MA-52等数据集上的准确性显著提高。

  15. TOOL · CL_206213 ·

    新的 mR^2AG 框架在 GPT-4o 之上提升了多模态 VQA 性能

    研究人员推出 mR$^2$AG,一个旨在提升多模态大语言模型 (MLLMs) 在知识型视觉问答 (VQA) 任务上性能的新框架。该新方法通过仅在必要时自适应地检索相关外部知识,并精确识别该知识中的支持证据,来解决现有方法的局限性。mR$^2$AG 框架利用两次反思操作来区分查询类型并定位有益信息,从而提高准确性并避免不必要的检索调用。它可以与现有的 MLLMs 集成,并在 INFOSEEK 和 Encyclopedic-VQA 等基准…

  16. TOOL · CL_204170 ·

    新的CVT-Bench评估MLLM在不同视角下的空间状态完整性

    研究人员推出CVT-Bench,这是一个旨在评估多模态大语言模型(MLLM)空间状态完整性的新诊断套件。该基准测试了MLLM在不同视角和竞争场景下保持预测一致性的能力,填补了当前评估中常常侧重于孤立任务的空白。对五种最先进MLLM的初步测试显示,模型存在显著的持久性损失,并生成了联合不可实现的(jointly unrealizable)状态,表明当前模型可能高估了它们在现实世界场景中的鲁棒性。

  17. TOOL · CL_204127 ·

    新的FIRM方法改进了遥感分割的掩码表示

    研究人员开发了FIRM,一种用于遥感推理分割中掩码细粒度令牌内表示的新颖方法。该方法通过预测视觉令牌内的子单元模式,而不是单一的二元标签,来解决当前多模态大语言模型(MLLMs)的局限性。FIRM增强了小型目标、细长结构和相邻实例的表示,从而提高了物体边界的精度。该方法通过有效恢复每个子单元内的细粒度细节,在EarthReason和LaSeRS等多个基准测试中取得了最先进的结果。

  18. RESEARCH · CL_206134 ·

    新的IVT框架将视频推理延迟降低5倍

    研究人员开发了内部化视觉思维(IVT),一个旨在增强多模态大型语言模型中主动视频推理的新框架。与生成中间图像的现有视觉CoT方法不同,IVT在训练期间训练模型预测未来的视觉表示。这使得模型能够在推理时直接进行推理,将延迟显著降低五倍以上,同时在各种视频推理任务上保持或提高性能。研究结果表明,显式的像素空间生成对于有效的视频推理并非必需,内部化的预测世界模型可以带来更准确、更高效的多模态推理器。

  19. TOOL · CL_200046 ·

    新的 EgoMonth 基准揭示 MLLM 在长期记忆方面存在困难

    引入了一个名为 EgoMonth 的新基准,用于评估多模态大语言模型(MLLM)的长期时空记忆。该基准包含来自 20 名参与者的超过 300 小时的第一人称视频记录,跨度长达 120 天,并包含 1,443 个由人类精心设计的问题。包括 Gemini 2.5 Pro 在内的当前最先进模型,与人类基线相比表现出显著的性能差距,尤其是在需要路线推理和空间判断的任务中。研究结果表明,现有的 MLLM 更像是会丢失信息的摘要器,而不是忠实的记…

  20. TOOL · CL_198329 ·

    新框架ForgeryVCR改进了多模态大语言模型在图像伪造检测方面的能力

    研究人员推出ForgeryVCR,一个旨在提高多模态大语言模型(MLLMs)在检测和定位图像伪造方面的准确性的新框架。与以往以文本为中心的方法(由于语言模态在捕捉细微像素不一致性方面的局限性而常常导致幻觉)不同,ForgeryVCR集成了高效的取证工具箱。该工具箱将不可察觉的痕迹物化为显式的视觉中间体,实现了视觉中心推理。该框架采用战略工具学习范式,结合监督微调和强化学习,使MLLMs能够主动调用多视图推理路径进行详细检查。