PulseAugur
中
实时 18:15:19
实体 Large Vision Language Models

Large Vision Language Models

PulseAugur coverage of Large Vision Language Models — every cluster mentioning Large Vision Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
88
90 天内 88
发布 · 30天
0
90 天内 0
论文 · 30天
88
90 天内 88
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/5 页 · 共 88 条
  1. TOOL · CL_287153 ·

    新的ReFIT框架通过自适应标记缩减加速视觉语言模型

    研究人员开发了ReFIT,一个新颖的框架,旨在提高大型视觉语言模型在处理高分辨率图像时的效率。ReFIT采用指令引导的视觉标记缩减,利用相关性引导窗口重塑(RWR)来识别和适应与指令相关的区域,并通过指令引导标记精炼(ITR)来消除多余的标记。这种方法旨在保留空间结构信息,例如通常在更简单的标记缩减方法中会丢失的长文本。在各种视觉问答基准上的实验表明,ReFIT在提高准确性的同时降低了计算需求。

  2. TOOL · CL_275466 ·

    新的防御机制Anti-Persona旨在对抗LVLMs中未经授权的身份绑定

    研究人员开发了一种名为Anti-Persona的新型防御机制,用于对抗个性化大型视觉-语言模型(LVLMs)中未经授权的身份绑定和识别。该方法通过识别和扰乱参考图像中的共享视觉特征,创建一个“身份原型”,从而破坏模型识别特定身份的能力。Anti-Persona旨在保护视觉保真度,同时实现对身份绑定的高保护率,并在各种任务中甚至在编码器不匹配的情况下都显示出有效性。

  3. TOOL · CL_273243 ·

    新方法TRC将LLM中的不受控制的重复减少了57%

    研究人员开发了一种名为Tokenwise Residual Comparison (TRC) 的新方法,用于识别和缓解大型语言模型和视觉-语言模型中不受控制的重复。该技术分析生成过程中的残差流动力学,以找出与重复输出相关的异常。实验表明,TRC能将循环率平均降低57%,并深入了解重复语义如何在模型层中产生和传播。

  4. RESEARCH · CL_271608 ·

    新的无训练框架解决了视频异常检测问题

    两篇新的研究论文介绍了一种新颖的视频异常检测无训练框架。Cog-VADU 利用认知推理方法和思维链提示策略来保持时间连续性并提高异常区分能力。PARSEE-VAD 采用一个双模块系统,将语义证据获取与分数状态演化分开,使用命题感知推理和流式证据升级来实现高效的在线检测。这两种方法都旨在在开放场景中提高泛化能力,而无需进行数据集特定的训练。

  5. RESEARCH · CL_271046 ·

    新研究应对 LVLM 中的多图像理解挑战

    两篇新研究论文探讨了大型视觉语言模型 (LVLM) 在多图像理解方面面临的挑战。第一篇论文介绍了“Mosaic”框架,该框架允许 LVLM 使用可组合的图像操作主动构建视觉中间结果,证明视觉重表示对于需要精确视觉证据的任务至关重要。第二篇论文提出了“FOCUS”,一种通过噪声掩码图像来缓解跨图像信息泄露的免训练方法,从而引导模型专注于单个干净图像,并提高了在各种多图像基准测试甚至视频理解方面的性能。

  6. RESEARCH · CL_271509 ·

    新框架通过软思维和自蒸馏增强LVLM空间推理能力 · 追踪3个来源

    研究人员开发了两种新方法来增强大型视觉语言模型(LVLM)的空间推理能力。一种方法是软空间推理(Soft Spatial Reasoning),它引入了一个“软思维”框架,允许模型在每个推理步骤中通过混合词嵌入来维持连续的软状态,而不是固定为单个离散词。这种方法包括一个AdaptSoft控制器来管理软化程度,并在各种空间基准测试中表现出改进的性能。第二种方法是Spatial-OPSD,它利用无标签的自蒸馏来提高空间推理能力,而无需依赖…

  7. TOOL · CL_268774 ·

    新基准UltraG-Bench评估VLM在超声图像中的关联能力

    研究人员推出UltraG-Bench,一个旨在评估大型视觉语言模型(VLM)在超声成像背景下像素级证据关联能力的新基准。该基准建立在40个公开的超声分割数据集之上,包含三个渐进式任务:指令引导分割、证据关联视觉问答和证据关联报告生成。对14个最先进模型的初步评估突显了语义理解与精确像素级定位之间的显著差异,促使了UltraG-Agent的开发。该代理整合了VLM的推理能力与专门的分割模型UltraSAM3,以增强语义预测和视觉关联。

  8. TOOL · CL_259485 ·

    研究发现视觉框架影响大型视觉语言模型的描述

    一篇新发表在arXiv上的论文探讨了视觉输入及其框架如何影响大型视觉语言模型(LVLM)生成的基于属性的描述。研究表明,即使文本提示是通用的,图像的存在和特定框架也能显著改变LVLM的输出。例如,展示一只特定狗的图像会改变模型对犬种的描述,不同的视觉框架会导致不同的响应,包括物理术语的增加。

  9. TOOL · CL_257180 ·

    新的ViD框架解决了视觉语言模型中的性别偏见问题

    研究人员推出了一种新颖的框架ViD,旨在缓解大型视觉语言模型(LVLMs)中的性别偏见。与需要训练阶段调整或事后校准的先前方法不同,ViD通过分析注意力机制来动态解决视觉偏见,而无需额外的训练开销。该框架采用后门调整和精炼的token选择,以抑制源于强大语言先验的偏见,同时保持通用的推理和文本生成质量。ViD在FACET和MS COCO等基准测试中显著减少了性别偏见,尤其提升了LLaVA模型的性能。

  10. TOOL · CL_231518 ·

    新框架ExpArt-KG增强LVLMs的艺术品描述能力

    研究人员开发了ExpArt-KG框架,旨在增强大型视觉语言模型(LVLMs)在艺术品描述方面的能力。该方法将知识图谱与检索增强生成相结合,使LVLMs能够更全面、准确地详细说明图像中的事实关系。该系统通过迭代生成描述并从知识图谱中检索相关信息,利用正确性判断来高效获取必要事实。实验表明,该方法提高了艺术品解释的细节,降低了知识检索成本,同时保持了生成质量。

  11. TOOL · CL_229456 ·

    新框架和基准改进了从图表中提取图拓扑的能力

    研究人员推出了TopoAgent,这是一个新颖的框架,旨在利用大型视觉语言模型改进从结构化图表中提取图拓扑。该框架附带TopoBench-180,这是一个包含180个图表的新基准数据集,分为Web风格和网络风格,并附有人工验证的图注释。TopoAgent通过整合基础感知、全局结构先验和拓扑一致性强制执行来提高准确性,在边缘提取方面尤其优于现有的视觉语言模型和视觉推理框架。

  12. TOOL · CL_227064 ·

    新数据集 Synth-JDoc 提升 LVLM 日语 OCR 性能

    研究人员开发了 Synth-JDoc,这是一个旨在提高大型视觉语言模型 (LVLM) 光学字符识别 (OCR) 能力的新型数据集,特别针对日语文本。该数据集使用 HTML 和 CSS 直接从文本合成文档图像,并结合了垂直和水平书写风格的多样化布局。为了增强真实性和鲁棒性,合成的文档包含由文本到图像模型生成的嵌入式图像,并经过噪声和降级滤镜处理。实验表明,在 Synth-JDoc 上微调的模型优于在先前合成数据集上训练的模型,显著提高了…

  13. RESEARCH · CL_227219 ·

    新的基准和方法解决了跨模态和跨领域的 LLM 幻觉问题

    研究人员正在开发新的方法和基准,以检测和减轻各种模态和领域的 LLM(大语言模型)中的幻觉。OmniHallu 为检测多模态理解和生成任务中的幻觉提供了一个统一的框架,并得到了新基准的支持。另一种方法侧重于特定领域的幻觉检测,结合分类、不确定性量化和偏好优化,以减少 Qwen2.5 等模型中的错误。对于法律应用,LexAgentHallu 被引入为一个基准,用于分析工具增强型法律代理中的幻觉,并突出代理的失败。此外,证据对齐实体验证 …

  14. RESEARCH · CL_218205 ·

    新研究解决视频和语言模型中的AI幻觉问题

    研究人员正在开发新的方法来对抗AI模型中的幻觉,特别是在视频-语言和大型语言模型方面。一种名为CounterVid的方法使用反事实视频生成来创建合成数据,以训练Qwen2.5-VL和InternVL3等模型更好地区分动作和时间顺序。另一种名为Prediction of Prediction (PoP) 的方法,通过在单次前向传播中分析内部隐藏状态动态来检测大型语言模型中的事实错误,在TruthfulQA基准测试上达到了75.5%的AU…

  15. TOOL · CL_217893 ·

    新基准和方法解决医疗AI中的跨语言视觉问答退化问题

    研究人员开发了一个新的基准和一种方法来解决多语言医疗视觉问答(VQA)中的跨语言退化问题。该基准涵盖八种语言和四种场景,揭示了大型视觉语言模型(LVLMs)在不同语言和能力上的表现不均衡。为了解决这个问题,他们提出了MedVL-XLRepE,一种无需训练的方法,它利用英语医疗VQA的性能在推理时改进非英语表示,并在多种LVLMs和语言中显示出持续的退化缓解效果。

  16. RESEARCH · CL_218983 ·

    新的SAGE框架通过多智能体推理增强古籍理解能力

    研究人员开发了SAGE,一个新颖的多智能体框架,旨在提高对中国古籍的理解能力。与目前直接生成答案的大型视觉语言模型(LVLM)不同,SAGE采用了一种结构化方法,涉及专门的智能体进行规划、证据获取和验证。这种方法可以进行更可靠、更准确的推理,甚至在证据不足时也能放弃回答。实验表明,SAGE,特别是使用Qwen3.5-9B模型时,在AncientDoc基准测试中表现优于更大、单一的LVLM。

  17. TOOL · CL_216000 ·

    Re$^3$Cap 使用检索引导的强化学习来改进图像字幕生成

    研究人员开发了 Re$^3$Cap,一种利用多模态检索引导的强化学习来改进图像字幕生成的新方法。该方法旨在克服标准强化学习在鼓励大型视觉语言模型(LVLMs)探索不同推理策略方面的局限性,从而缩小与监督微调的性能差距。Re$^3$Cap 能够识别并纠正字幕中的幻觉和遗漏,生成更准确、更详细的描述,并在 COCO-LN500 基准测试中展现出优于包括 GRPO 在内的现有方法的性能。

  18. RESEARCH · CL_212014 ·

    新的AI越狱方法利用了时间和描述性漏洞

    研究人员开发了新的方法来绕过AI模型的安全过滤器,这些方法同时针对大型视觉语言模型(LVLMs)和文本到图像(T2I)模型。一种名为TempJail的技术,通过操纵字幕时间和调度来引发有害响应,从而利用LVLMs的时间漏洞。另一种名为Etch的方法,通过将有害文本嵌入生成的图像中来针对T2I模型,绕过了传统的基于视觉的安全措施。这两种方法在绕过当前AI安全对齐方面都取得了显著的成功率。

  19. RESEARCH · CL_216380 ·

    新研究探讨了大型语言模型和视觉-语言模型的先进越狱技术及检测方法

    研究人员正在开发先进的方法来测试大型语言模型和视觉-语言模型在面对越狱尝试时的安全性和鲁棒性。SEAV等新框架专注于验证模型响应的正确性和程序准确性,而不仅仅是语义上的合理性。其他研究引入了元自适应攻击,该攻击会优化攻击者本身以利用多模态模型的漏洞,在GPT-4o和Gemini 3 Pro Preview等领先模型上取得了高成功率。此外,还在探索通过分析模型激活来检测未见过越狱攻击的方法,旨在提高安全评估的泛化能力和效率。

  20. TOOL · CL_208192 ·

    TAMP-Nav 框架增强大型视觉语言模型(VLMs)的具身导航能力

    研究人员推出 TAMP-Nav,一个旨在增强大型视觉语言模型(VLMs)具身导航能力的新框架。该方法将导航任务重新构建为二维视觉提示,使 VLMs 能够选择像素,然后将这些像素投影到三维坐标以执行。TAMP-Nav 还包含一个选择性推理机制,仅在关键节点触发思维链(Chain-of-Thought),并使用锚点轨迹记忆(Anchor-Trajectory Memory)来压缩冗余路径。该框架在 R2R-CE 等基准测试中取得了最先进的…