PulseAugur
实时 12:57:03
实体 Qwen2-VL-2B-Instruct

Qwen2-VL-2B-Instruct

PulseAugur coverage of Qwen2-VL-2B-Instruct — every cluster mentioning Qwen2-VL-2B-Instruct across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_165043 ·

    小型视觉语言模型在图像退化下表现出置信度差距

    一项近期研究考察了Qwen2-VL-2B-Instruct和SmolVLM-Instruct这两个小型视觉语言模型在真实图像退化下的置信度信号。研究发现,在自然语言中声明的置信度与内部标记概率之间存在显著差异。虽然内部概率被证明是更可靠的错误指标,但在面对严重曝光不足时,两个模型都难以准确评估其置信度,导致准确性大幅下降,而置信度信号变化甚微。

  2. RESEARCH · CL_169653 ·

    新的RAG技术增强科学文档理解 · 2篇论文

    两篇新研究论文介绍了用于科学文档理解的高级检索增强生成(RAG)技术。第一篇论文《使用开源SLM进行科学文档理解的多模态混合检索增强生成》提出了一种系统,该系统使用开源视觉语言模型(Qwen2-VL-2B-Instruct)进行多模态摄取,并结合HNSW和GIN搜索的混合检索策略,检索质量提高了157%。第二篇论文《HVM-GraphRAG: 复杂文档上的整体视图多模态图检索增强生成》提出了一个框架,该框架构建概念级图来索引多模态证据…

  3. TOOL · CL_158250 ·

    Image2Prompt 扩展为 SD WebUI Forge Neo 生成图像提示

    为 SD WebUI Forge Neo 开发了一个名为 Image2Prompt 的新扩展,使用户能够从图像生成文本提示。该工具直接集成到 Stable Diffusion 界面中,可以进行提示的逆向工程或直接图像字幕生成。它支持多种视觉语言模型,包括各种 Qwen 模型和微软的 Florence-2,并支持从 Hugging Face 自动下载。

  4. TOOL · CL_66176 ·

    新框架降低医学VQA中的幻觉风险

    研究人员开发了Ask4VG,一个旨在减轻医学视觉问答系统中幻觉答案的新框架。该方法通过分析模型在呈现修改或缺失图像数据时答案的变化,来识别和优先处理不太可能引起视觉不支持响应的问题。通过根据这种估计的风险对问题进行重新排序,Ask4VG旨在提高医学VQA系统的可靠性和准确性,这在基准数据集上通过降低幻觉风险和提高准确性得到了证明。