研究人员开发了C$^3$PO,一个旨在评估全模态模型跨模态推理能力的新基准。该基准包含视频、音频、图像和文本共3,404个样本,专门测试模型组合来自不同模态信息和解决故意矛盾的能力。研究发现,尽管人类准确率很高,但即使是Gemini-3.1 Pro等先进模型也表现不佳,其中很大一部分失败归因于模态主导,即模型优先考虑一种输入类型而非其他,特别是文本。 AI
影响 突出了当前全模态AI的关键局限性,表明未来架构必须优先考虑持续的跨模态注意力而非模态主导。
排序理由 该集群包含一篇详细介绍用于评估AI模型的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →