一篇新发表在 arXiv 上的研究论文评估了六种前沿语言模型在一项名为 log(N)-Questions 游戏(通信效率任务)中的表现。该游戏涉及同一模型的两个实例,一个充当提问者,另一个充当回答者,仅通过 log(N) 个是/否问题来从 N 个维基百科摘要的集合中识别目标文档。Claude Opus-5 的表现明显逊于 GLM 5.3、GPT 5.6 "Sol"、Grok 4.6、Gemini 3.8 Flash 和 Kimi K3,并且随着文档集大小的增加,其胜率下降。研究发现,每个问题的平均信息量与胜率相关,而通过标题对文档进行分区的模型表现更好。 AI
影响 突出了领先 LLM 在通信效率和策略性文档分区方面的差异,可能影响未来的模型开发。
排序理由 评估前沿语言模型在一项新任务上的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →