PulseAugur
实时 19:27:56
实体 MMBench

MMBench

PulseAugur coverage of MMBench — every cluster mentioning MMBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_229040 ·

    新的ReVA模型通过区域感知AI增强视觉问答能力

    研究人员开发了ReVA,一种新颖的区域感知视觉助手,旨在改进多模态大型语言模型(MLLMs)在视觉基础问答方面的能力。ReVA通过将整幅图像和区域级别的表示纳入其处理过程,解决了空间推理和细粒度视觉理解方面的局限性。该模型利用双桥将这些表示与LLM的嵌入空间对齐,采用了CLIP ViT-L/14 Vision Transformer和Qwen2.5-7B-Instruct LLM。通过整合来自RAM++和Grounding DINO等…

  2. TOOL · CL_196025 ·

    新的GAM-Agent框架通过博弈论提升LLM的视觉推理能力

    研究人员开发了GAM-Agent,一个采用博弈论方法增强大型语言模型视觉推理能力的新框架。该系统将推理过程视为一个非零和博弈,其中专业代理进行协作,并有一个专门的代理确保逻辑一致性和事实准确性。该框架使用结构化通信,包括不确定性估计,并设有一个不确定性感知控制器,在出现分歧时启动多轮辩论,从而产生更鲁棒和可解释的结果。实验表明,GAM-Agent在MMMU和MMBench等基准测试中显著提升了性能,使小型模型性能提升高达6%,大型模型…

  3. TOOL · CL_193652 ·

    新的TGIF模块可减少多模态大语言模型的幻觉

    研究人员开发了TGIF(文本引导的层间融合),这是一种旨在减少多模态大语言模型(MLLMs)幻觉的新型模块。与以往侧重于文本或静态视觉特征融合的方法不同,TGIF根据输入查询动态地融合来自视觉编码器不同层的视觉特征。这种方法无需更新视觉编码器,并且计算开销极小。当与LLaVA-1.5-7B集成时,TGIF在减少幻觉和提高OCR和VQA任务的性能方面表现出持续的改进,同时在ScienceQA和MMBench等其他基准测试上保持或提高了结果。

  4. TOOL · CL_179288 ·

    MAViE编码器将视觉语言模型效率提升80%

    研究人员推出MAViE,一种多尺度自适应视觉编码器,旨在提高视觉语言模型的效率和有效性。MAViE利用位置依赖门控来整合来自视觉Transformer不同深度的特征,从而在保留全局语义的同时增强边缘和文本等局部细节的表示。该系统还采用问题条件令牌路由,根据图像复杂性和问题相关性来调整其令牌预算,显著减少处理的视觉令牌数量并提高推理速度。

  5. RESEARCH · CL_147799 ·

    新的SD-MAR框架提升了VLM在多图像上的分析推理能力

    研究人员推出SD-MAR,一个旨在增强视觉语言模型(VLM)在多图像分析推理能力的新框架。该框架利用通过受控扰动生成的合成数据,为变化检测和定量比较等任务创建场景。通过采用一种名为GRPO-lite with Backward Discounted Allocation的强化学习方法,在SD-MAR上训练的模型在领域内准确性方面显示出显著的改进,其中Qwen2.5-VL-7B在基准测试中超越了GPT-4.1。至关重要的是,这些改进并未…