ScienceQA
PulseAugur coverage of ScienceQA — every cluster mentioning ScienceQA across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
GraphLoom框架通过知识图谱改进多模态RAG
研究人员推出GraphLoom,一个旨在增强多模态检索增强生成(RAG)系统的新型框架。该系统从包括场景描述和外部常识知识在内的各种数据源构建多模态知识图谱。然后,GraphLoom通过分层图记忆槽和联合图-序列注意力选择性地路由高实用性证据,而不是注入所有检索到的信息。这种方法旨在提高答案质量和证据忠实度,尤其是在具有嘈杂或广泛证据池的复杂推理场景中。
-
新的TGIF模块可减少多模态大语言模型的幻觉
研究人员开发了TGIF(文本引导的层间融合),这是一种旨在减少多模态大语言模型(MLLMs)幻觉的新型模块。与以往侧重于文本或静态视觉特征融合的方法不同,TGIF根据输入查询动态地融合来自视觉编码器不同层的视觉特征。这种方法无需更新视觉编码器,并且计算开销极小。当与LLaVA-1.5-7B集成时,TGIF在减少幻觉和提高OCR和VQA任务的性能方面表现出持续的改进,同时在ScienceQA和MMBench等其他基准测试上保持或提高了结果。
-
新的VSSD技术增强了小型语言模型的多模态推理能力
研究人员开发了一种名为视觉显著性引导蒸馏(VSSD)的新技术,以提高小型语言模型在多模态思维链(CoT)推理方面的能力。VSSD利用大型模型的注意力图来指导蒸馏,有助于保留在融合过程中常常丢失的细微跨模态差异。该方法旨在提高模型生成推理过程和推断答案的能力,尤其是在图像和文本几乎无法区分的挑战性场景中。在ScienceQA和M$^3$CoT数据集上的实验显示出有希望的改进。
-
研究发现视觉令牌修剪会影响多模态大语言模型的校准
一篇新的研究论文探讨了视觉令牌修剪对多模态大语言模型(MLLMs)校准的影响。该研究发表在arXiv上,揭示了修剪令牌的方法显著影响模型校准,即模型置信度与其正确性之间的一致性。基于覆盖率的修剪方法,侧重于保持证据覆盖率,在LLaVA-1.5和Qwen2-VL等各种模型上,以最小的准确率损失实现了校准的改进。相比之下,基于注意力的修剪方法有时会导致准确率下降和过度自信增加。
-
新数据集训练LLM进行K-12教育风险评估 · 跟踪3个来源
研究人员开发了AIriskEval-edu-db2,这是一个旨在训练和评估大型语言模型(LLMs)用于评估K-12教育内容中教学风险的新数据集。该数据集包含来自ScienceQA问题的1600多个解释,其中包含人类编写的示例以及旨在展示特定风险的LLM生成的示例。它还包含了可解释性的结构化注释,在事实准确性、完整性、相关性、恰当性和意识形态偏见等维度上定位和描述风险。验证实验将专有模型与本地Llama 3.1 8B模型进行了比较,探索…