Qwen2.5-VL-7B
PulseAugur coverage of Qwen2.5-VL-7B — every cluster mentioning Qwen2.5-VL-7B across labs, papers, and developer communities, ranked by signal.
- 2026-05-29 research_milestone A new framework significantly improves the view planning capabilities of Qwen2.5-VL-7B in 3D environments. 来源
10 天有情绪数据
-
新的空间潜在推理框架提高了视觉基础的准确性
研究人员开发了一个名为空间潜在推理(SLR)的新框架,以提高指向性视觉基础的准确性。SLR围绕几何和视觉状态的有序序列构建监督,利用指尖位置和指向方向来指导过程。该方法在EgoPoint-Ground和YouRefIt等基准测试中提高了性能,与现有技术相比有了显著改进,尤其是在Qwen3.5-4B、Qwen2.5-VL-7B和Qwen3-VL-8B等模型上。
-
新型对抗性攻击针对自动驾驶领域的视觉语言模型
研究人员开发了一种名为时空连贯性对抗性攻击(STCA)的新型对抗性攻击方法,该方法专门针对自动驾驶系统使用的黑盒视觉语言模型(VLMs)。该攻击分为三个阶段:用于语义帧选择的模态扩展,用于在保持相似性的同时创建扰动的空间攻击,以及使用运动引导掩码来破坏时间连贯性的STCA阶段。在BDD100K和nuScenes数据集上使用Video LLaVA-7B、Qwen2.5-VL-7B和Dolphin等模型进行的实验表明,当前的VLMs极易受…
-
新的MWOP技术通过定向剪枝提升MLLM效率
研究人员开发了一种名为“模态感知宽度操作剪枝”(MWOP)的新方法,以提高多模态大语言模型(MLLM)的效率。MWOP通过独立剪枝视觉到视觉、文本到视觉和文本到文本的注意力路径,并分别选择视觉和文本输入的FFN通道,来解决注意力头和前馈网络(FFN)通道内的冗余问题。这种方法在保留令牌序列的同时减少了计算量,从而显著加快了速度。在LLaVA-OneVision-7B上,MWOP单独实现了1.6倍的预填充速度提升,且性能损失极小;与令牌…
-
新的AVSD-Scenes数据集增强了城市场景的视听描述能力
研究人员推出了AVSD-Scenes,一个旨在利用音频和视觉信息描述城市环境的新数据集。该数据集包含超过12,000条描述,这些描述是通过结合Qwen2-Audio-7B和Qwen2.5-VL-7B等模型的模态特定输出来生成的。然后,使用Qwen3-14B、Mistral-Small-3.2-24B-Instruct-2506和Gemma-3-27B-it等大型语言模型对这些描述进行了进一步优化,以捕捉互补信息。基准测试表明,与单一模…
-
新AI方法通过自蒸馏和自一致性提升视频推理能力
两篇新研究论文探讨了增强AI模型视频推理能力的新颖方法。第一篇论文介绍了帧差分策略内自蒸馏(FD-OPSD)技术,该技术在强化学习训练过程中将密集帧观测的证据转移到稀疏帧策略上,从而提高了Qwen2.5-VL-7B和Qwen3-VL-4B等模型在视频推理基准上的性能。第二篇论文研究了基于扩散的视频推理的自一致性,提出了一种无需训练的方法,通过聚合多个视频生成的预测来实现视觉搜索和迷宫解决等任务的更高准确性,并引入了拒绝微调(RFT)将…
-
新的RL方法改进LLM代理和多代理系统的信用分配 · 跟踪9个来源
多篇研究论文介绍了用于改进代理和多代理系统强化学习(RL)中信用分配的新方法。这些方法旨在更准确地将结果归因于特定决策或行动,尤其是在涉及大型语言模型(LLM)或协作多代理控制的复杂场景中。技术包括可验证可行性表示、分段重加权、近端熵、半事实稳定性以及空间信用分配,在各种基准测试中通常优于现有基线。
-
新的强化学习方法用更少的 token 提升多模态大语言模型的视觉感知能力
研究人员开发了一种新颖的强化学习方法 Vision-RL2,用于增强多模态大语言模型(MLLMs)的细粒度视觉感知能力。该方法通过将连贯的图像区域视为动作,并根据其对多模态大语言模型答案可能性的影响进行评分,来优化区域提议网络。Vision-RL2 在各种基准测试和多模态大语言模型骨干网络上显著提高了准确性,同时大幅减少了所需的视觉 token 数量,从而降低了计算成本。
-
新的ReDraft方法通过修订模型失败来改进LLM的后续训练
研究人员开发了一种名为ReDraft的新方法,用于持续对大型多模态模型进行后续训练。该技术旨在在不牺牲现有能力的情况下增强新能力,这是模型训练中的一个常见挑战。ReDraft通过使用模型自身错误的输出来作为修订的基础,并以专家响应作为参考来实现这一点。然后,模型会优化其输出,并且只有被接受的修订才用于微调,从而在最小化遗忘先前知识的同时提高新任务的性能。
-
AI工作流程筛查南非食品的钠含量合规性
研究人员开发了一种支持OCR的工作流程,用于根据监管限值筛查南非包装食品的钠含量。该系统结合了区域检测、光学字符识别和视觉-语言模型,以对产品进行分类并识别属于R214范围之内或之外的产品。对442种产品的评估表明,集成工作流程和独立的Qwen2.5-VL 7B模型在类别分配和范围确定方面取得了高度一致,证明了基于图像的自动化筛查在食品安全法规管理方面的潜力。
-
新方法提高视频问答的准确性和可靠性 · 跟踪3个来源
研究人员正在开发先进的方法来提高视频问答(VideoQA)模型的可靠性和准确性。一种方法侧重于通过分析响应图并使用直方图梯度提升等技术来优化答案级别的可靠性分数,该方法在HERBench和Perception Test等基准测试中取得了显著改进。另一种方法LOVER采用课程学习策略,将模型从长距离推理适应到短距离推理,在GQA基准测试中取得了最先进的成果。此外,一个名为AutoSkill的框架根据问题类型自动发现和路由帧选择技能,通过…
-
新的JPPO攻击通过优化像素和提示来利用视觉语言模型
研究人员开发了一种名为联合像素-提示优化(JPPO)的新型对抗性框架,该框架以视觉语言模型(VLMs)为目标。与以往专注于图像扰动的方法不同,JPPO联合优化图像像素和用户可见的提示,以放大资源耗尽攻击。这种方法显著增加了Qwen2.5-VL-7B和BLIP-2等模型的延迟和能耗,揭示了当前VLM服务防御中潜在的安全漏洞。
-
World Labs 发布 Atlas,一个用于空间智能的全能世界模型 · 跟踪 8 个来源
World Labs 推出了 Atlas,一个专为空间智能设计的新型 AI 模型,能够从图像、视频、文本和深度数据等各种输入生成、重建和模拟 3D 世界。与专用模型不同,Atlas 将所有输入整合到一个统一的空间上下文中,使其能够生成更一致、更详细的 3D 表示。该模型旨在通过提供对空间关系和场景动态的更深入理解来推动机器人技术、模拟和 3D 内容创作的发展。
-
新方法利用合成数据和时间分析增强AI对长视频的理解 · 跟踪4个来源
研究人员正在开发新方法,以改进大型多模态模型理解长视频的方式。一种名为SynMulti的方法使用合成数据生成管道,为对象计数和问答等任务创建无限的带注释视频数据,表明合成数据可以很好地泛化到现实世界场景。其他方法,如RIDGE和Temporal Tree of Thought (T^3),通过分析视频中的时间信号和分层结构来专注于高效帧选择,以更好地捕捉关键时刻和上下文。STITCH提供了一种无需训练的方法,将视频分割成有意义的时间块…
-
新数据集和MASON范式推动VLM组合式布局理解
研究人员推出了CoDeLayout,这是一个专注于视觉语言模型(VLM)组合式布局理解的新数据集和任务。该数据集包含约20,000个真实世界的多层布局,旨在解决当前VLM在解释复杂、分层设计方面的局限性。为了应对语义漂移和结构歧义等挑战,开发了一种名为MASON的训练后范式,它增强了元素解释和空间关系建模。
-
PACE框架通过优化视觉编码器和LLM来加速VLM推理
研究人员推出了一种新颖的免训练框架PACE,旨在加速视觉语言模型(VLM)的推理速度。PACE通过统一的压缩和提取范式优化视觉编码器和LLM,解决了现有方法的局限性。该框架包含一个自适应像素压缩器,用于在编码前对冗余视觉输入进行下采样,以及一个动态双注意力提取器,用于选择性地保留任务关键的视觉标记。与Qwen2.5-VL-7B集成后,PACE在仅使用10%视觉标记的情况下,实现了3.1倍的首个标记生成时间加速,同时保持了原始性能的93.8%。
-
大型语言模型简洁提示可省钱,缩短输入提示成本更高
一项新研究发现,指示大型语言模型(LLM)在输出时保持简洁,可以在不影响准确性的情况下显著降低成本。该研究测试了包括 OpenAI、Anthropic 等公司模型在内的九种不同大型语言模型,结果显示平均节省成本 1.5 倍,在某些情况下甚至高达 3 倍。相反,缩短输入提示被证明是适得其反的,会导致成本增加和准确性下降,因为模型会试图弥补丢失的信息。研究还指出,虽然简洁的输出通常是正确的,但它们并不总是能反映模型不受限制的推理过程。
-
新基准揭示视觉语言模型安全推理差距
名为SafeGesture的新基准已被开发出来,用于评估视觉语言模型(VLM)在安全关键场景下的细粒度手势理解能力。该基准将六种手势与八种操作环境配对,共产生4,800个评估项。对GPT-4o和Qwen2.5-VL-7B等模型的初步测试显示,手势识别准确率与安全行为推断之间存在显著差距,表明推理安全情景是当前VLM面临的主要挑战。
-
新的GAM-Agent框架通过博弈论提升LLM的视觉推理能力
研究人员开发了GAM-Agent,一个采用博弈论方法增强大型语言模型视觉推理能力的新框架。该系统将推理过程视为一个非零和博弈,其中专业代理进行协作,并有一个专门的代理确保逻辑一致性和事实准确性。该框架使用结构化通信,包括不确定性估计,并设有一个不确定性感知控制器,在出现分歧时启动多轮辩论,从而产生更鲁棒和可解释的结果。实验表明,GAM-Agent在MMMU和MMBench等基准测试中显著提升了性能,使小型模型性能提升高达6%,大型模型…
-
真实世界数据对化学结构识别的AI准确性至关重要
一篇新研究论文探讨了真实世界文档中光学化学结构识别(OCSR)的挑战,强调了合成数据和实际专利及期刊图表之间的性能差距。该研究使用合成数据和真实世界数据的混合体对包括Qwen2.5-VL-7B、InternVL3-8B和GLM-4.1V-9B在内的多种视觉语言模型(VLM)进行了微调。结果表明,纳入标记的真实训练图像对于提高准确性至关重要,最佳配置在一个基准测试上实现了0.84的精确匹配。研究还发现,视觉塔适应策略(如LoRA)的有效…
-
Qwen2.5-VL 7B 在 M1 Max 上的 OCR 速度与文本长度相关,而非图像复杂度
最近在 M1 Max 64GB 机器上对 Qwen2.5-VL 7B 模型进行的测试表明,图像复杂度对光学字符识别 (OCR) 任务的处理速度没有显著影响。相反,需要转录的文本长度是决定输出速度的主要因素,在模型初始加载后,处理速度在每秒 23.4 到 26.0 个 token 之间。测试还表明,虽然该模型非常准确,尤其是在处理收据等结构化数据时,但在较长、自由格式的文本中偶尔会出现一些小错误,在一个 356 个字符的日语文档中发现了…