实体
Ming-Flash-Omni-2.0
Ming-Flash-Omni-2.0
PulseAugur coverage of Ming-Flash-Omni-2.0 — every cluster mentioning Ming-Flash-Omni-2.0 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的TraceAV-Bench凸显OmniLLM在长时音视频推理方面的挣扎
一项新的基准测试TraceAV-Bench已被推出,用于评估OmniLLMs在长时音视频上的多跳推理能力。该基准测试包含578个视频中的2200个问题,总时长超过339小时,并评估了多模态幻觉鲁棒性。包括Gemini 3.1 Pro和Ming-Flash-Omni-2.0在内的当前领先模型显示出显著的局限性,表现最好的模型准确率仅为68.29%,表明在长时音视频推理方面存在巨大差距。
-
新基准揭示AI视频推理能力的局限性
研究人员推出了TraceAV-Bench,一个旨在评估处理长音频-视频时多跳推理能力的新基准。该基准包含578个视频中的2200多个问题,总时长超过339小时,平均推理链长度为3.68跳。包括Google的Gemini 3.1 Pro和名为Ming-Flash-Omni-2.0的开源模型在内的当前领先模型,准确率仅分别为68.29%和51.70%,显示出显著的局限性。该基准还强调,对多模态幻觉的鲁棒性与一般推理性能没有强相关性。