一项实验通过询问一个名为AuriKey的不存在的工具,测试了五个当前一代的大语言模型——Claude Opus 4.7、Claude Sonnet 4.6、GPT-5、Gemini 2.5 Pro和Grok 4。在没有提供上下文的情况下,所有模型都出现了幻觉,其中Grok 4产生了最具体但完全虚构的细节,而Claude模型提供了更诚实但不太具体的回答。当提供一份关于AuriKey的简短虚构文档作为上下文时,最初观察到的显著性能差距急剧缩小,这表明上下文工程比模型选择更能影响大语言模型的响应。 AI
影响 强调了上下文工程在大语言模型性能和诚实性方面比模型选择起到的关键作用。
排序理由 该条目是用户发布的观点文章和实验分析,而非来自前沿实验室的直接发布或公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →