一项名为 DogLM 的新基准测试显示,大型语言模型在推断隐含用户意图方面存在困难,尤其是在生成内容的互动元素方面。在 17 种不同大型语言模型生成的 804 款浏览器游戏中,除非明确提示,否则模型很少会使背景中的狗产生互动。即使有提示添加有趣的机制,也只有一小部分游戏包含任何形式的玩家与狗的互动,允许实际“摸狗”的则更少。 AI
影响 凸显了大型语言模型在理解和响应隐含用户需求方面的能力差距,表明需要改进人工智能开发中的对齐和推理能力。
排序理由 该条目描述了一个新的基准测试及其关于大型语言模型能力的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →