PulseAugur
实时 09:32:21
实体 InternVL3

InternVL3

PulseAugur coverage of InternVL3 — every cluster mentioning InternVL3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_254894 ·

    视觉-语言模型在手写考试评分方面展现潜力

    研究人员评估了各种视觉-语言模型(VLM)在基于成果的教育中对手写考试进行评分的有效性。该研究比较了包括 Qwen2.5-VL、InternVL3 和 Pixtral 在内的配置,并使用了零样本提示、少样本提示和低秩适配(LoRA)等方法。使用 LoRA 的 Qwen2.5-VL 实现了 0.727 的 Quadratic Weighted Kappa (QWK) 分数,超过了平均人类配对 QWK 的 0.551,显示出自动评分的潜力…

  2. TOOL · CL_254875 ·

    StepPrune方法通过自适应选择视觉标记来加速多模态大语言模型推理

    研究人员开发了一种新颖的StepPrune方法,用于在多模态大语言模型(MLLMs)中自适应地选择视觉标记以加速推理。与之前独立处理标记的Top-K方法不同,StepPrune根据先前选择的标记和文本上下文来顺序选择标记,动态确定要保留的标记数量。该方法在LLaVA-1.5上已显示出显著的性能保留,实现了94.6%的完整前缀归一化性能,同时删除了88.9%的视觉标记。该方法还实现了1.50倍的预填充速度提升,将延迟从59.95毫秒降低…

  3. RESEARCH · CL_218205 ·

    新研究解决视频和语言模型中的AI幻觉问题

    研究人员正在开发新的方法来对抗AI模型中的幻觉,特别是在视频-语言和大型语言模型方面。一种名为CounterVid的方法使用反事实视频生成来创建合成数据,以训练Qwen2.5-VL和InternVL3等模型更好地区分动作和时间顺序。另一种名为Prediction of Prediction (PoP) 的方法,通过在单次前向传播中分析内部隐藏状态动态来检测大型语言模型中的事实错误,在TruthfulQA基准测试上达到了75.5%的AU…

  4. TOOL · CL_212171 ·

    新数据集CAViAR揭示自动驾驶AI关键推理差距

    研究人员推出了CAViAR,一个旨在提高自动驾驶系统因果推理能力的新数据集。该数据集包含2,249个真实世界事故视频,并附有诸如责任归属和违规行为等细节标注。对Qwen3-VL和InternVL3等当前视觉-语言模型的基准测试显示出显著的性能差距,尤其是在事故类型和责任推理方面,突显了现有AI在安全关键场景中的感知-推理能力存在关键差距。

  5. TOOL · CL_181153 ·

    新研究探讨视觉语言模型与纯视觉模型在自动驾驶中的应用

    研究人员开发了一种新的端到端驾驶系统方法,通过比较视觉语言模型(VLMs)和传统的纯视觉编码器。他们的研究发现,尽管两种模型在策略学习后共享显著的表征重叠,但它们保留了影响驾驶行为的独特残差因素。纯视觉模型在更简单、侧重几何的任务中表现出色,而视觉语言模型在复杂、长尾场景中表现更好。该研究提出了混合和双系统架构,利用两者的互补优势,从而提高驾驶模拟的准确性和效率。

  6. TOOL · CL_79169 ·

    新框架探测多模态大语言模型的内部决策压力

    研究人员开发了一个名为 S$^3$E 的新框架,通过在语义压力下探测多模态语言模型的内部决策状态来评估它们。该方法将图像支持的字幕与语义上相似但错误的选项进行对比,分析隐藏状态以检测模型即使在外部行为保持正确时也可能存在的内部不稳定性。对 Qwen3VL、Gemma3 和 InternVL3 等模型的研究表明,语义压力会导致显著的内部状态位移,这表明仅凭外部正确性不足以保证稳定的内部决策几何。

  7. RESEARCH · CL_76916 ·

    新方法通过漂移敏感数据增强多模态大语言模型隐私

    研究人员开发了Anchored Privacy Drifting (APD),一种新颖的无需训练的方法,用于增强多模态大语言模型(MLLMs)的隐私。APD通过在保留关键情境线索的同时,对隐私敏感元素进行语义修改,来解决用户输入和视觉情境可能包含敏感信息的挑战。使用AdaptShield(一个旨在评估隐私保护和情境效用的新基准)对APD的有效性进行了评估,结果显示在多个MLLM系列中均有显著改进。

  8. RESEARCH · CL_66037 ·

    新方法通过压缩内容和改进时序推理来提升视频问答能力

    研究人员开发了新的方法来改进长视频问答(VQA)。其中一种方法 MemoryCard 将视频内容压缩成面向主题的“记忆卡”,以更好地捕捉事件级语义,并将准确率提高高达 21.8%。另一种方法 TLG 通过重建视频时间线并将问题路由到专用模型来专注于时序逻辑推理,在正式的时序逻辑推理基准测试中实现了 24.5 的绝对准确率提升。另一项关于隐式视频问答的研究表明,对于当前基准测试而言,感知能力比高级推理技术更关键。