Qwen2.5-VL-7B
PulseAugur coverage of Qwen2.5-VL-7B — every cluster mentioning Qwen2.5-VL-7B across labs, papers, and developer communities, ranked by signal.
- 2026-05-29 research_milestone A new framework significantly improves the view planning capabilities of Qwen2.5-VL-7B in 3D environments. 来源
10 天有情绪数据
-
大型语言模型简洁提示可省钱,缩短输入提示成本更高
一项新研究发现,指示大型语言模型(LLM)在输出时保持简洁,可以在不影响准确性的情况下显著降低成本。该研究测试了包括 OpenAI、Anthropic 等公司模型在内的九种不同大型语言模型,结果显示平均节省成本 1.5 倍,在某些情况下甚至高达 3 倍。相反,缩短输入提示被证明是适得其反的,会导致成本增加和准确性下降,因为模型会试图弥补丢失的信息。研究还指出,虽然简洁的输出通常是正确的,但它们并不总是能反映模型不受限制的推理过程。
-
新基准揭示视觉语言模型安全推理差距
名为SafeGesture的新基准已被开发出来,用于评估视觉语言模型(VLM)在安全关键场景下的细粒度手势理解能力。该基准将六种手势与八种操作环境配对,共产生4,800个评估项。对GPT-4o和Qwen2.5-VL-7B等模型的初步测试显示,手势识别准确率与安全行为推断之间存在显著差距,表明推理安全情景是当前VLM面临的主要挑战。
-
新的GAM-Agent框架通过博弈论提升LLM的视觉推理能力
研究人员开发了GAM-Agent,一个采用博弈论方法增强大型语言模型视觉推理能力的新框架。该系统将推理过程视为一个非零和博弈,其中专业代理进行协作,并有一个专门的代理确保逻辑一致性和事实准确性。该框架使用结构化通信,包括不确定性估计,并设有一个不确定性感知控制器,在出现分歧时启动多轮辩论,从而产生更鲁棒和可解释的结果。实验表明,GAM-Agent在MMMU和MMBench等基准测试中显著提升了性能,使小型模型性能提升高达6%,大型模型…
-
真实世界数据对化学结构识别的AI准确性至关重要
一篇新研究论文探讨了真实世界文档中光学化学结构识别(OCSR)的挑战,强调了合成数据和实际专利及期刊图表之间的性能差距。该研究使用合成数据和真实世界数据的混合体对包括Qwen2.5-VL-7B、InternVL3-8B和GLM-4.1V-9B在内的多种视觉语言模型(VLM)进行了微调。结果表明,纳入标记的真实训练图像对于提高准确性至关重要,最佳配置在一个基准测试上实现了0.84的精确匹配。研究还发现,视觉塔适应策略(如LoRA)的有效…
-
Qwen2.5-VL 7B 在 M1 Max 上的 OCR 速度与文本长度相关,而非图像复杂度
最近在 M1 Max 64GB 机器上对 Qwen2.5-VL 7B 模型进行的测试表明,图像复杂度对光学字符识别 (OCR) 任务的处理速度没有显著影响。相反,需要转录的文本长度是决定输出速度的主要因素,在模型初始加载后,处理速度在每秒 23.4 到 26.0 个 token 之间。测试还表明,虽然该模型非常准确,尤其是在处理收据等结构化数据时,但在较长、自由格式的文本中偶尔会出现一些小错误,在一个 356 个字符的日语文档中发现了…
-
新基准和方法推动AI多模态推理发展
研究人员正在开发用于多模态知识图谱补全和推理的新方法,将视觉语言模型(VLM)与图结构相结合。ViSR-KGC提出了一种视觉子图推理方法,结合了表示学习和VLM分析来推断缺失的实体。Q-CueGraph专注于查询条件下的视觉证据图谱,以指导VLM在多模态推理任务中检查图像。此外,还开发了一个从讲座视频构建证据支撑的多模态知识图谱的流程,并引入了一个名为GraphVerse的综合基准来评估多模态大语言模型在视觉图谱推理方面的能力。
-
新方法通过关注集体消息来压缩 VLM 视觉数据
研究人员开发了一种名为 Grounded Message Coreset Pruning (GMC) 的新方法,用于高效压缩视觉语言模型 (VLM) 的视觉信息。与以往将视觉 token 独立处理的方法不同,GMC 专注于保留语言解码器所需的集体消息。该方法旨在通过最小化处理的视觉 token 数量来降低推理成本,同时保持模型性能。实验表明,GMC 可以在能力损失最小的情况下显著减少 token 使用量,甚至在某些情况下能提高性能。
-
VisualRouter框架增强了LVLMs的长视频理解能力
研究人员推出VisualRouter,一个旨在改进大型视觉语言模型(LVLMs)处理长视频方式的新框架。该框架无需训练,即插即用,通过智能选择信息帧来解决上下文窗口有限的挑战。VisualRouter将查询分为全局或局部类型,并为每种类型应用不同的采样策略,以增强相关性、时间覆盖率和多样性。
-
ObjectStream 框架使用潜在对象进行流视频理解 · arXiv
研究人员推出了一种新颖的框架 ObjectStream,旨在通过使用潜在对象作为记忆锚点来增强流视频理解。这种无需训练的方法直接从冻结的 Video-LLM 表示中提取空间连贯的潜在对象,并将它们跨帧链接起来,在有限的内存预算内维护持久的历史记录。ObjectStream 保留了对象的历史、变化和最近的视觉上下文,使 Video-LLM 能够在不改变基础模型的情况下推理对象的身份、交互和状态变化。实验表明,在性能和效率方面都有显著提高…
-
新的“一次思考”方法通过路由现有证据改进高分辨率视觉问答
研究人员开发了一种名为“一次思考”(Thinking-Once)的新方法,用于高分辨率视觉问答(HR-VQA)。该技术侧重于高效地路由多模态模型中间层中已存在的证据,而不是通过裁剪或重新编码来重复获取新的视觉输入。“一次思考”方法重建了条件于问题的注意力机制,以保留关键实体标记和上下文,并将它们路由到后续层,而无需额外的视觉处理。该方法在各种基础模型上都展示了持续的改进,尤其是在V$^*$Bench、HRBench-4K和HRBenc…
-
OmniAD框架通过多模态推理增强工业异常检测
研究人员开发了OmniAD,一个旨在检测和分析工业异常的新型多模态推理框架。该系统集成了视觉和文本推理,使用“文本即掩码编码”方法进行异常检测,并采用“视觉引导文本推理”进行全面分析。OmniAD采用监督微调和强化学习相结合的训练策略,在MMAD基准测试中获得79.1分,性能优于Qwen2.5-VL-7B和GPT-4o等模型。
-
新的LVLM框架通过最小化监督提升文档信息提取能力
研究人员开发了一种新颖的分类引导框架,用于大型视觉语言模型(LVLM),以改进从复杂文档中提取视觉信息的能力。该方法将文档类型分类与内容提取分离,并使用动态提示工程进行上下文学习,以实现跨不同布局的高效零样本推理。在投标数据集上进行测试,使用Qwen2.5-VL-7B的零样本方法显著优于有监督基线,F1分数提高了18.35个百分点,归一化编辑距离提高了0.23。进一步的微调增强了性能,证明了该框架对印章和水印等常见文档损坏具有鲁棒性。
-
Trace环境提升视觉语言模型推理性能
研究人员开发了Trace,一个旨在提高语言模型视觉推理能力的新环境。该环境利用场景语法和可执行任务程序生成跨越11个领域的1000个不同的视觉推理任务,以创建可验证和可复现的训练数据。当应用于Qwen2.5-VL模型时,在Trace实例上进行训练带来了显著的性能提升,其中Qwen2.5-VL-7B在24个基准测试的宏平均性能上提高了4.06个百分点。
-
MedLVR框架通过潜在视觉推理增强医学VQA
研究人员开发了MedLVR,一个新颖的框架,通过将潜在视觉推理整合到模型的解码过程中来增强医学视觉问答(VQA)。与严重依赖以文本为中心的推理的传统方法不同,MedLVR明确地纳入了一个视觉证据状态,允许在生成答案之前迭代地优化与查询相关的视觉信息。这种方法旨在通过更好地保留对临床诊断至关重要的细微视觉细节来提高VQA系统的可靠性。在OmniMedVQA数据集和其他医学VQA基准上的实验表明,MedLVR显著提高了性能,将Qwen2.…
-
新的SLAPBench基准测试对MLLM进行指纹验证
研究人员推出了SLAPBench,这是首个旨在评估多模态大语言模型(MLLM)在四指SLAP指纹验证方面的基准测试。该基准测试使用NIST SD302b数据构建,用于测试MLLM从SLAP图像(四指的平面活体扫描印记)中验证身份的能力。初步评估表明,提示策略对模型性能有显著影响,某些提示会导致多个开源模型出现近100%的错误接受率。Claude Opus 4.8在应对这些提示问题方面表现出卓越的韧性,取得了最佳的二元验证结果,而其他模…
-
新的SD-MAR框架提升了VLM在多图像上的分析推理能力
研究人员推出SD-MAR,一个旨在增强视觉语言模型(VLM)在多图像分析推理能力的新框架。该框架利用通过受控扰动生成的合成数据,为变化检测和定量比较等任务创建场景。通过采用一种名为GRPO-lite with Backward Discounted Allocation的强化学习方法,在SD-MAR上训练的模型在领域内准确性方面显示出显著的改进,其中Qwen2.5-VL-7B在基准测试中超越了GPT-4.1。至关重要的是,这些改进并未…
-
新方法剪枝Token以实现高效3D问答
研究人员开发了一种新颖的在线Token剪枝方法,旨在提高多模态大语言模型(MLLMs)在3D问答任务中的效率。该方法将输入帧投影到共享的体素空间,识别并剪枝空间重叠的区域,以在图像Token进入语言模型之前减少冗余。该方法无需额外训练,可将Token使用量减少高达50%,并在应用于Qwen2.5-VL-7B和Qwen3-VL-8B等模型后,在ScanQA、SQA3D和OpenEQA-HM3D等基准测试中表现出性能提升。
-
研究论文质疑LLM记忆探测的可靠性
一篇新研究论文使用Qwen2.5-VL-7B模型,探讨了探测器选择对大型语言模型记忆判断的影响。研究确定了三种标准探测器产生误导性结果的情况:由于窗口截断导致的假阴性,非秘密漂移导致的假阳性,以及欠训练基线上的模糊下降。作者建议采用多方面的方法来报告记忆情况,包括全跨度秘密NLL、局部分解、行为精确召回和诱饵探测,以确保秘密特异性的准确断言。
-
新的DSP-SLAM++框架增强了实时对象SLAM能力
研究人员推出了一款名为DSP-SLAM++的统一框架,旨在改进面向对象的同步定位与地图构建(SLAM)系统。该新框架解决了实时性能、多类别对象支持和高保真对象模型生成之间的权衡问题。DSP-SLAM++通过异步建图管线和针对单目鱼眼-激光雷达设置的专用传感器融合,实现了高达70%的处理延迟降低,并支持实际的现实世界应用。
-
新的VLM-Judge协议可靠评估3D网格质量
研究人员开发了一种使用视觉语言模型(VLM)进行去偏评估的协议,用于评估从单张图像生成的3D网格质量。该协议通过使用不同的VLM裁判进行训练和评估,并实施位置偏差校正,旨在提供比CLIP相似度或几何有效性等传统代理指标更可靠的评估。虽然该协议在识别故障模式方面被证明是有效的,并被用于调整名为TRELLIS的生成器,但调整方法在公共数据集上训练时并未超越基础模型的性能。研究表明,要超越基础性能,仅在公共数据集上进行轻量级参数高效微调是不…