PulseAugur
实时 12:01:33
实体 prompt-region grounding

prompt-region grounding

PulseAugur coverage of prompt-region grounding — every cluster mentioning prompt-region grounding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_185225 ·

    新的VTS方法揭示MLLMs在视觉指令方面存在困难

    研究人员推出了一种名为视觉化任务语义(VTS)的新颖方法,用于评估多模态大型语言模型(MLLMs)在多大程度上理解图像中以视觉形式呈现的指令。当问题被移入图像时,在六个MLLMs和四个基准测试中,准确率平均下降了17.8个百分点,这表明模型在处理视觉指令方面与处理文本相比存在显著差距。为了解决这个问题,研究团队开发了提示-区域对齐技术,该技术将问题区域与类型化语义对齐,在推理时无需OCR或区域元数据即可将VTS准确率从58.0%提高到66.3%。