Qwen2.5-VL
PulseAugur coverage of Qwen2.5-VL — every cluster mentioning Qwen2.5-VL across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新型视觉语言模型无需OCR即可提取文档数据,性能超越大型模型
研究人员开发了一种从文档图像中提取键值对的新方法,无需依赖传统的OCR预处理。他们对一个名为SmolDocling的紧凑型2.56亿参数视觉语言模型进行了微调,以端到端地执行此任务,联合处理识别、定位和关联。据报道,这种方法在FUNSD和XFUND等基准测试上的表现优于大型零样本视觉语言模型,同时比Qwen2.5-VL等模型更小、更快。
-
新框架Zero-MELO提升MLLM微手势识别能力
研究人员开发了Zero-MELO,一个旨在提高多模态大语言模型(MLLMs)在微手势识别(MGR)方面性能的新框架。该框架通过引入一种测试时证据校准方法,解决了MLLMs在处理细粒度和以动作为中心任务方面的局限性。该方法使用树搜索机制收集局部视觉证据,并使用校准模块纠正分数偏差,与基线模型相比,在iMiGUE和MA-52等数据集上的准确性显著提高。
-
新框架提升AI长视频理解效率
研究人员开发了两个新框架EcoFrame和EviSelect,旨在提高大型语言模型处理长视频理解的效率。EcoFrame采用一种无需训练的方法,根据模型的输出不确定性和注意力模式来调整帧选择过程,实现了显著的加速,并且准确性与现有方法相当。EviSelect则采用一种基于目标模型内部注意力的动态视觉选择方法,通过自适应地调整采样率和空间分辨率,同时优化准确性和效率。
-
新的PhyCheck数据集评估视频大语言模型对物理定律的理解
研究人员推出了PhyCheck,这是一个旨在评估和改进视频大语言模型(VideoLLMs)物理定律理解能力的新数据集。该数据集包含粗粒度和细粒度子集,用于评估模型是否能识别物理定律的违规行为以及导致这些违规行为的具体细节。使用PhyCheck数据对Qwen2.5-VL进行微调的实验表明,物理一致性有了显著提高,尽管当前模型在整合额外的因果背景方面仍存在困难。
-
新框架通过视觉令牌和自我诊断增强视觉语言模型推理能力 · 跟踪3个来源
研究人员开发了新的框架来增强视觉语言模型(VLMs)的推理能力。其中一种方法,Chain-of-Visual-Thought(COVT),使用连续的视觉令牌来捕获密集的感知信息,当集成到Qwen2.5-VL和LLaVA等模型中时,在各种基准测试上的性能提高了3-16%。另一种方法,ReGround,通过使VLMs能够自我诊断和重新检查视觉证据,解决了多步推理中视觉基础丢失的问题,在视觉密集型任务上显示出持续的收益,并且推理开销适中。此…
-
新方法增强多模态大语言模型空间推理能力 · 跟踪4个来源
研究人员开发了新的方法来提高多模态大语言模型(MLLMs)的空间推理能力。SpatialCLI 使用专业的视觉模型作为工具来增强 MLLMs 的感知和推理能力,在 MindCube 等基准测试中取得了显著的性能提升。另一种方法 ByDeWay-V2 将显式的空间关系上下文与深度线索相结合,以减少幻觉并提高可审计性,在 BLINK 和 VSR 基准测试中表现强劲。第三篇论文介绍了视觉信用审计(VCA),用于评估空间基准测试在多大程度上依…
-
新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源
三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。
-
新方法剪枝视觉令牌以实现高效MLLM推理 · 跟踪4个来源
研究人员开发了多种新方法来高效剪枝多模态大语言模型(MLLM)的视觉令牌,旨在降低推理成本和延迟。LAST框架利用最后一个查询令牌的注意力来指导剪枝,无需访问云端模型,即可在将令牌数量减少87.5%的同时保留94.5%的准确率。SFPruner将剪枝重新构建为单次前向传播,将Qwen2.5-VL的令牌选择时间从112.4毫秒显著缩短至2.5毫秒。SPARE是另一种方法,将剪枝视为子空间重建,通过最小化重建误差并纳入“反相关性”标准,在…
-
Qwen Image Edit Plus 可通过文本命令编辑图像中的文本
“Jimniting”(源自Gemini)已成为通过文本命令编辑图像的热门俚语,尤其用于更改图像内的文本。阿里巴巴的开源模型Qwen Image Edit Plus被重点介绍,它能够添加、删除和替换图像中的文本,并旨在保留原始字体、大小和样式。虽然Qwen Image Edit在中文和英文文本编辑的基准测试中表现强劲,但其对西里尔文文本的有效性仍未经验证,并且中国大陆以外的用户可能需要通过变通方法才能访问。
-
Visionary 应用简化了 macOS 上的 AI 数据集创建
Visionary 是一款新的、本地运行的 macOS 应用程序,旨在简化为 AI 模型构建和策划训练数据集的过程。它整合了多个现有工具的功能,提供近乎重复项检测、按人物或分辨率对图像进行分组以及标签管理等功能。该应用程序与各种字幕模型集成,并支持与 kohya 和 diffusers 等流行训练框架兼容的导出格式。
-
新型AI模型架构解决跨模态否定检测问题
研究人员发现当前多模态AI系统面临一个重大挑战:难以检测不同模态之间的高级语义概念(如否定)。他们的分析表明,标准的视觉-语言模型通常无法在其潜在空间中编码可泛化的否定信号,主要关注模态特定的特征。为解决此问题,开发了一种新颖的跨模态注意力架构,该架构显式地建模了模态间的依赖关系,并在F1分数上比单一模态基线模型提高了高达7.03%。研究还发现否定存在不对称性,视觉否定在语义上依赖于语言上下文,这一发现得到了使用Qwen2.5-VL对…
-
新的ARMOR++框架增强了深度伪造攻击的可迁移性
研究人员开发了ARMOR++,一个新颖的多智能体框架,旨在增强针对深度伪造检测器的攻击的可迁移性。该系统利用Qwen2.5-VL视觉语言模型作为语义先验,并使用Qwen3大型语言模型来编排攻击原语。在AADD-2025基准测试上的评估表明,ARMOR++的性能显著优于现有方法,凸显了当前深度伪造检测技术中存在的持续性漏洞。
-
AutoV框架通过视觉提示检索增强LVLM性能
研究人员开发了AutoV,一个旨在通过智能检索最佳视觉提示来提高大型视觉语言模型(LVLM)性能的新框架。该方法通过根据输入图像和文本查询自动从池中选择最合适的视觉提示,解决了传统提示工程的局限性。AutoV利用面向损失的排序系统进行监督,使其能够在没有手动标注的情况下学习有效的提示检索。实验表明,AutoV在图像理解和分类等各种任务中显著提高了LVLM的性能,在LLaVA-OV和Qwen2.5-VL等模型上取得了显著改进。
-
VLMs 实现开放词汇视频场景图生成
一种新的视频场景图生成(SGG)方法利用视觉语言模型(VLMs)来创建视频内容的结构化、机器可读的描述。与依赖固定词汇的传统 SGG 方法不同,这种方法使用 Qwen2.5-VL 等开放词汇 VLMs 直接从视觉和语言线索生成描述。该过程包括从视频中选择关键帧,然后使用 VLM 识别对象、人物及其关系,形成一个可编程分析的图。
-
针对大批量发票提取微调视觉语言模型
一篇技术博文详细介绍了为高效发票提取微调视觉语言模型的过程。作者描述了构建一个每日可处理超过 50,000 份发票的光学字符识别 (OCR) 管道。该管道利用 Qwen2.5-VL 和 Llama 3.2 Vision 等模型来实现大批量数据处理。
-
新方法逐个标记追踪多模态大语言模型注意力
研究人员开发了一种名为“逐个标记”(OTaT)的新方法,用于分析多模态大语言模型(MLLMs)在响应生成过程中如何利用视觉和文本信息。该技术追踪对图像、文本、指令和先前生成标记的注意力转移,揭示了各种MLLMs之间的一致模式。研究发现,当需要图像派生信息时,对图像的注意力达到峰值;在任务转换期间会重新审视指令;随着时间的推移,对生成标记的注意力会增加。基于这些发现的干预措施显著提高了多模态任务的性能。
-
新的AI框架通过先进的记忆和推理能力解决长视频理解问题
研究人员正在开发先进的框架,以改进AI模型理解和推理长视频的方式。例如,Homer使用分层记忆系统,按时间因果联系组织信息,在M3-Bench-robot等基准测试中表现优于现有方法。Latent-VC通过在解码器中保留视觉记忆来解决“视觉锚定衰减”问题,从而实现更准确、更简洁的视频推理。EGAgent采用实体场景图和代理规划来实现以自我为中心的视频理解,而Light-Omni则提供了一种具有双重上下文状态以实现高效处理的反射式、轻量…
-
新的半监督CoT框架通过伪监督增强LLM推理能力
研究人员推出了一种新颖的半监督思维链学习框架Semi-CoT,该框架利用未标记问题生成伪推理监督。该方法通过基于估计的答案级语义熵来选择可靠的推理链,从而改进了CoT的自训练方法。虽然实验在选择高精度伪CoT方面显示出潜力,但有效利用仍需要改进演示选择或学生训练策略。
-
NVIDIA 发布 Qwen-Image-Flash 以实现快速文本到图像生成
NVIDIA 发布了 Qwen-Image-Flash 模型,这是 Qwen/Qwen-Image 模型的蒸馏版本,专为快速文本到图像生成而设计。该模型采用四步 DMD2 蒸馏过程,并针对 NVIDIA 硬件进行了优化,提供更快的推理速度。它适用于商业和非商业用途,面向开发人员和研究人员,用于创意内容原型设计和对延迟敏感的应用。
-
新框架提升大语言模型高分辨率图像感知能力
研究人员推出了一种名为分层实体探索(HEE)的新型框架,旨在增强多模态大语言模型(MLLMs)的高分辨率图像感知能力。与需要大量训练或依赖固定图像分割的现有方法不同,HEE无需训练且模型无关。它通过首先评估区域是否有足够证据,然后使用对象检测进行细粒度细节分析,并将这些信息组织成语义层次结构,来动态指导实体探索。该方法旨在通过置信度引导的回溯实现自适应感知,从而克服当前高分辨率图像处理中常见的细节丢失问题。