PulseAugur
中
实时 13:26:33
实体 LVLMs

LVLMs

PulseAugur coverage of LVLMs — every cluster mentioning LVLMs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
48
90 天内 48
发布 · 30天
0
90 天内 0
论文 · 30天
48
90 天内 48
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/3 页 · 共 48 条
  1. RESEARCH · CL_271509 ·

    新框架通过软思维和自蒸馏增强LVLM空间推理能力 · 追踪3个来源

    研究人员开发了两种新方法来增强大型视觉语言模型(LVLM)的空间推理能力。一种方法是软空间推理(Soft Spatial Reasoning),它引入了一个“软思维”框架,允许模型在每个推理步骤中通过混合词嵌入来维持连续的软状态,而不是固定为单个离散词。这种方法包括一个AdaptSoft控制器来管理软化程度,并在各种空间基准测试中表现出改进的性能。第二种方法是Spatial-OPSD,它利用无标签的自蒸馏来提高空间推理能力,而无需依赖…

  2. TOOL · CL_254505 ·

    新的 TestHallVQA 基准测试探究 LVLM 在冗余上下文中的推理能力

    研究人员推出了 TestHallVQA,这是一个新的基准测试,旨在评估大型视觉语言模型 (LVLM) 在文档级推理方面的能力,特别是在存在冗余或不相关信息的情况下。该基准测试旨在通过结合文档规模和人类考试的复杂性来解决现有 VQA 数据集的局限性。TestHallVQA 还引入了一种新颖的指标 F1-R extsuperscript{2},用于评估推理能力和对抗上下文冗余的鲁棒性。

  3. TOOL · CL_239296 ·

    新的PetQA基准评估AI兽医知识

    研究人员开发了PetQA,这是一个旨在评估大型语言模型(LLMs)和大型视觉语言模型(LVLMs)的兽医知识和临床推理能力的新基准。该基准包含超过10,000个问答对,这些问答对源自关于狗和猫的真实查询,并由兽医专家提供答案。使用ROUGE和BERTScore等指标对十八个模型进行的初步评估显示,当前AI系统在兽医护理方面存在局限性,突显了改进适应方法的必要性。

  4. RESEARCH · CL_245016 ·

    新的合成数据集增强了 LVLM 的空间推理能力

    研究人员推出了 SpatialBlock,这是一个旨在提高大型视觉语言模型 (LVLM) 的空间智能的合成数据集。该数据集包含 15,000 个块堆叠问题,涵盖 3D 到 2D 投影、视点转换和结构组合,并结合了基于锚点的推理的颜色调制。实验表明,在 SpatialBlock-15k 上训练的 LVLM 在现实世界的空间任务上的表现优于现有模型,尽管训练数据具有合成性质,但仍能有效泛化。

  5. TOOL · CL_228882 ·

    新的Cen-Prune方法通过优化视觉令牌剪枝来提高LVLM效率

    研究人员开发了一种名为Cen-Prune的新方法,通过优化视觉令牌(visual tokens)的剪枝方式来提高大型视觉语言模型(LVLM)的效率。标准的基于多样性的剪枝依赖于余弦相似度,但原始视觉令牌的相似度过于集中,难以有效地区分冗余令牌。在计算相似度之前对令牌特征进行中心化可以揭示更丰富的结构,但会因丢失全局独特令牌的信息而降低性能。Cen-Prune通过使用中心化余弦相似度来衡量多样性,同时保留原始空间的独特性,从而在各种基准…

  6. TOOL · CL_227064 ·

    新数据集 Synth-JDoc 提升 LVLM 日语 OCR 性能

    研究人员开发了 Synth-JDoc,这是一个旨在提高大型视觉语言模型 (LVLM) 光学字符识别 (OCR) 能力的新型数据集,特别针对日语文本。该数据集使用 HTML 和 CSS 直接从文本合成文档图像,并结合了垂直和水平书写风格的多样化布局。为了增强真实性和鲁棒性,合成的文档包含由文本到图像模型生成的嵌入式图像,并经过噪声和降级滤镜处理。实验表明,在 Synth-JDoc 上微调的模型优于在先前合成数据集上训练的模型,显著提高了…

  7. TOOL · CL_218893 ·

    新基准揭示 LVLM 在交互式视觉基础方面存在困难

    一篇新的研究论文介绍了一个用于评估大型视觉语言模型(LVLM)中交互式视觉基础的框架。研究强调,当前的 LVLM 在需要对话来完善或获取目标信息的任务方面存在困难,表现远低于人类基线。研究还发现,LVLM 的校准性很差,报告的置信度常常超过实际准确率,这表明在视觉匹配、信息检索和综合能力方面需要进一步发展。

  8. TOOL · CL_218209 ·

    新的基准测试和训练方法提升了多语言 LVLM 的性能

    研究人员推出了 PM4Bench,这是一个旨在评估大型视觉语言模型 (LVLM) 多语言能力的新基准测试。该基准测试使用了跨越 10 种语言的平行语料库,并包含一个将文本直接嵌入图像中的视觉设置,模拟现实世界的代理交互。实验表明,光学字符识别 (OCR) 显著影响了跨语言性能差距。为解决此问题,开发了一种使用合成的、无标签数据的以 OCR 为中心的强化学习策略,该策略提高了多语言视觉问答能力并减小了跨语言差异。

  9. RESEARCH · CL_218205 ·

    新研究解决视频和语言模型中的AI幻觉问题

    研究人员正在开发新的方法来对抗AI模型中的幻觉,特别是在视频-语言和大型语言模型方面。一种名为CounterVid的方法使用反事实视频生成来创建合成数据,以训练Qwen2.5-VL和InternVL3等模型更好地区分动作和时间顺序。另一种名为Prediction of Prediction (PoP) 的方法,通过在单次前向传播中分析内部隐藏状态动态来检测大型语言模型中的事实错误,在TruthfulQA基准测试上达到了75.5%的AU…

  10. RESEARCH · CL_212014 ·

    新的AI越狱方法利用了时间和描述性漏洞

    研究人员开发了新的方法来绕过AI模型的安全过滤器,这些方法同时针对大型视觉语言模型(LVLMs)和文本到图像(T2I)模型。一种名为TempJail的技术,通过操纵字幕时间和调度来引发有害响应,从而利用LVLMs的时间漏洞。另一种名为Etch的方法,通过将有害文本嵌入生成的图像中来针对T2I模型,绕过了传统的基于视觉的安全措施。这两种方法在绕过当前AI安全对齐方面都取得了显著的成功率。

  11. RESEARCH · CL_216380 ·

    新研究探讨了大型语言模型和视觉-语言模型的先进越狱技术及检测方法

    研究人员正在开发先进的方法来测试大型语言模型和视觉-语言模型在面对越狱尝试时的安全性和鲁棒性。SEAV等新框架专注于验证模型响应的正确性和程序准确性,而不仅仅是语义上的合理性。其他研究引入了元自适应攻击,该攻击会优化攻击者本身以利用多模态模型的漏洞,在GPT-4o和Gemini 3 Pro Preview等领先模型上取得了高成功率。此外,还在探索通过分析模型激活来检测未见过越狱攻击的方法,旨在提高安全评估的泛化能力和效率。

  12. TOOL · CL_210440 ·

    新的TTSD-FAR方法通过缺失数据增强LVLM中的情感识别能力

    研究人员开发了一种名为TTSD-FAR的新方法,用于提高大型视频语言模型(LVLM)在测试期间某些数据模态缺失时的情感识别能力。该方法结合了测试时自蒸馏(TTSD)和Fisher锚定恢复(FAR)。TTSD使用一个固定的教师模型来指导一个自适应的学生模型,而FAR则监控自适应过程的稳定性,并在检测到分布偏移时将学生模型恢复到教师的锚点。在MELD和DFEW等数据集上的实验表明,TTSD-FAR的性能始终优于现有方法,尤其是在其他技术性…

  13. RESEARCH · CL_198083 ·

    新的 LookBack 方法改进了视觉语言模型的评分

    研究人员开发了一种名为 LookBack 的新方法,以更好地评估大型视觉语言模型 (LVLM) 的响应。现有的方法,从标准语言模型改编而来,难以评估 LVLM 的文本输出与提供的图像的匹配程度。LookBack 通过引入一个“视觉回溯得分”来解决这个问题,该得分衡量每个响应 token 与图像 token 的关联强度,在没有显著计算开销的情况下提高了准确性。这种方法在多个基准测试和模型上都显示出了一致的改进。

  14. TOOL · CL_196086 ·

    研究发现 LVLM 在图像序列时间推理方面存在困难

    一项新的研究论文强调了当前大型视觉语言模型(LVLM)评估图像序列中时间推理能力的一个关键缺陷。研究表明,这些模型表现出显著的偏见,例如首因效应和近因效应,其中图像帧的位置不成比例地影响它们对叙事连贯性而非语义一致性的判断。这表明现有的基于 Transformer 的裁判模型不适合评估视觉叙事的时间流程,因此有必要开发新的评估范式,将序列视为统一的逻辑结构。

  15. TOOL · CL_195987 ·

    SafeCap 框架通过字幕介导的强化学习增强 LVLM 的安全性

    研究人员开发了 SafeCap,一个旨在增强大型视觉语言模型 (LVLM) 安全性的新型强化学习框架。该方法训练一个策略模型,使其在生成最终答案之前生成与安全相关的图像字幕。字幕生成通过指导冻结的 LLM 做出安全决策的程度进行优化,鼓励模型暴露对安全响应至关重要的视觉线索。在多个安全性和效用基准上的评估表明,SafeCap 在各种模型设置下显著提高了安全性表现,同时保持或增强了视觉效用,其表现优于 SFT、DPO 和 SafeGRP…

  16. TOOL · CL_201669 ·

    LVLMs 因位置偏差而在图像序列时间推理方面遇到困难

    一篇新论文强调了大型视觉语言模型(LVLMs)在评估图像序列中的时间推理方面存在一个关键缺陷。目前用作裁判的 LVLMs 表现出显著的偏差,倾向于帧的位置(优先效应和近因效应)而非其语义一致性。这种结构性限制,可能源于 transformer 架构,意味着这些模型难以区分连贯的叙事与混乱或矛盾的叙事。该研究呼吁开发将视觉序列视为统一逻辑结构的、具有时间意识的评估范式。

  17. TOOL · CL_202788 ·

    SafeCap 框架使用图像字幕强化学习增强 LVLM 的安全性

    研究人员开发了 SafeCap,这是一个新颖的强化学习框架,旨在增强大型视觉语言模型 (LVLM) 的安全性。SafeCap 利用一种学习到的自字幕机制,模型首先为图像生成一个与安全相关的字幕,然后该字幕会指导生成最终的、对齐的响应。这种方法在安全基准测试中显示出显著的改进,在保持视觉效用的同时,其表现优于监督微调和直接偏好优化等现有方法,甚至有所提高。

  18. TOOL · CL_191279 ·

    新研究评估金融领域视觉语言模型的置信度

    一篇新的arXiv论文探讨了用于图表和文档理解的金融视觉语言模型(LVLMs)的置信度估计。研究强调,尽管许多模型可以将正确答案的排名置于错误答案之上,但它们通常存在严重的过度自信问题,导致其得分在决策中不可靠。研究发现,只有经过训练的内部探针,而非仅推理的基线,才能产生可阈值的得分,并且这些探针的有效性因具体模型和任务而异。研究结果表明,可实现的自动化程度主要取决于模型的内在能力,而置信度得分仅能缩小可安全自动化的范围。

  19. RESEARCH · CL_172065 ·

    新研究显示,LVLM 在处理视觉错觉方面存在困难

    研究人员正在调查大型视觉语言模型(LVLM)在理解视觉错觉方面的局限性。一项研究提出将视觉错觉用作诊断工具,以评估 LVLM 的联合感知和推理能力,发现当前模型的表现不如宣传的那样先进。另一篇论文介绍了一个名为 IlluChar 的新数据集和一种名为 SMSP 的策略,以解决 LVLM 在处理错觉时观察到的高频注意力偏差,并在 Qwen3-VL-8B-Instruct 等模型中展示了显著的性能提升。

  20. RESEARCH · CL_167243 ·

    新方法应对多模态虚假信息检测 · 跟踪到2个来源

    研究人员开发了检测多模态虚假信息的新方法,以应对人类制造和AI生成的欺骗性内容的挑战。一种方法是验证笔记本学习(VNL),它使用非参数框架,通过从过去的验证中创建决策原则和证据线索的“笔记本”来指导大型视觉语言模型(LVLMs)。该方法旨在在不重新训练模型的情况下提高来源归属和知识积累。另一项开发是OmniFake基准数据集和统一多模态虚假内容检测(UMFDet)框架,该框架旨在通过采用具有类别感知专家混合适配器的VLM骨干来处理单一…