PulseAugur
中
实时 22:43:28
实体 AI2D

AI2D

PulseAugur coverage of AI2D — every cluster mentioning AI2D across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. SIGNIFICANT · CL_257923 ·

    国产开源模型ZDTaichu5.0-9B引领空间AI

    一款新的开源多模态大模型ZDTaichu5.0-9B已发布,在空间具身和通用智能方面展现出领先能力。该模型在九项国际空间理解基准测试中取得了顶尖性能,在需要复杂空间判断和行动规划的任务中表现出色。尽管其参数量相对较小(90亿),ZDTaichu5.0-9B在文本理解、OCR、数学推理和编码方面也保持了强劲性能,使其在该类别中跻身全球顶尖模型之列。

  2. TOOL · CL_231415 ·

    新数据集SciGram提升AI对科学图表的理解能力

    研究人员开发了一个新的框架,用于生成大规模科学图表理解的指令数据。该方法从科学课程中提取概念,综合事实,并检索相关图表,以创建包括字幕和多项选择题在内的多模态监督。由此产生的数据集SciGram包含超过194,000张图表和140万个跨学科的视觉指令。在SciGram上训练的模型在TQA、ScienceQA和AI2D等以图表为中心的基准测试中表现出显著的改进,甚至在训练实例较少的情况下也优于最先进的视觉语言模型。

  3. RESEARCH · CL_06584 ·

    新基准DRAGON和OmniSch测试LMM的图表推理能力

    研究人员推出了DRAGON,这是一个旨在评估视觉语言模型(VLM)在多大程度上能够将其推理与图表中的特定视觉证据联系起来的新基准。该基准解决了模型可能通过虚假关联而非真正理解视觉信息而获得正确答案的局限性。DRAGON包含来自六个现有图表问答数据集的超过11,000个带注释的问题实例,其中测试集包含经过人类验证的推理证据注释。评估了八个VLM在各种图表类型中定位这些证据的能力,旨在提高基于图表的推理的可解释性和可靠性。