PulseAugur
实时 10:03:33
English(EN) BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

新的BEAR-Bench评估多模态模型处理复杂的英语和俄语文档的能力

研究人员推出了BEAR-Bench,这是一个旨在评估多模态大语言模型(MLLMs)在处理复杂的、文本密集的英语和俄语文档时的推理能力的新基准。该基准解决了现有评估的局限性,这些评估通常侧重于简单的信息提取或严重偏向英语和中文。BEAR-Bench包含1000个源自商业和科学文本的人工标注问题,对包括Gemini-3.1 Pro和Qwen3.5-397B在内的16个MLLMs进行的初步评估显示,即使是表现最好的模型也有很大的改进空间。该研究还利用基准的输出来比较现有的幻觉检测方法。 AI

影响 该基准有望推动多模态LLM在处理多语言专业文档时的推理能力得到提升。

排序理由 该集群描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的BEAR-Bench评估多模态模型处理复杂的英语和俄语文档的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev ·

    BEAR-Bench:多模态模型的双语企业与学术推理基准

    arXiv:2608.17895v1 Announce Type: cross Abstract: While Multimodal Large Language Models (MLLMs) have made significant strides in visual comprehension, their ability to reason about text-dense, professional documents remains incompletely evaluated. Existing benchmarks emphasize i…