来自MIT何恺明团队的研究人员开发了NAT-ARC,这是一种使用纯视觉方法解决ARC(Abstraction and Reasoning Corpus)挑战的新颖方法。与以往依赖大型语言模型的方法不同,NAT-ARC利用了一个在ImageNet上预训练的视觉编码器,特别是使用了Masked Autoencoder (MAE)技术。这种预训练使模型能够从猫和狗等自然图像中学习通用的视觉理解,然后有效地迁移到彩色网格上的抽象推理任务。NAT-ARC的最佳单模型在ARC-1上达到了63.4%的pass@2分数,集成模型达到了70.2%,这表明纯视觉解决方案现在可以在这个困难的基准测试中与基于LLM的方法相媲美。 AI
影响 展示了预训练视觉模型在抽象推理方面的潜力,挑战了LLM在ARC等基准测试中的主导地位。
排序理由 介绍一种针对具有挑战性的AI基准测试的新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →