两篇新研究论文指出了当前AI模型的局限性。一篇题为“Frontier Language Models Struggle to Copy”的论文揭示,即使是先进的大型语言模型也因依赖位置编码而在简单的字符串复制任务中失败。为解决此问题,研究人员提出了2D-RoPE,它将文本组织在二维网格中,显著提高了复制能力。第二篇论文“VISTA-Bench”引入了一个基准来测试视觉语言模型(VLMs)在可视化文本上的表现。研究发现了一个显著的差距,VLMs在嵌入图像中的文本上的表现不如纯文本,这表明需要跨模态的更统一的语言表示。 AI
影响 强调了LLMs和VLMs的基本局限性,表明需要新的架构方法和评估方法来实现更强大的AI。
排序理由 两篇学术论文发布在arXiv上,提出了与AI模型能力相关的新发现和基准。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →