2024年发表在ICML会议上的一篇论文指出,包括GPT-4o和Gemini-1.5模型在内的最先进多模态大型语言模型,在泛化需要操纵和组合游戏规则时表现糟糕。该论文由麻省理工学院的研究人员和弗吉尼亚理工大学的一名个人撰写,提出了这些“钥匙门谜题”作为高级AI评估的潜在基准。Reddit帖子的作者质疑了这些谜题的当前状态及其对未来万亿参数Agentic Swarm的影响。 AI
影响 强调了当前LLM在复杂规则操纵方面的潜在局限性,表明需要更强大的基准。
排序理由 该集群讨论了一篇在会议上发表的研究论文,该论文评估了当前大型语言模型的能力。[lever_c_demoted from research: ic=1 ai=1.0]
- ARC-AGI-3
- ARC-AGI-4
- ARC Foundation
- Baba
- Francois Chollet
- Gemini-1.5-Flash
- Gemini-1.5-Pro
- GPT-4o
- MIT
- Virginia Tech
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →