对OpenAI、Gemini和Claude的AI搜索能力进行的最新分析揭示了重大的可靠性问题。从5月到9月进行的、用于测量AI搜索准确性的预先注册测试未能证实其有效性。主要发现包括每日响应不一致、测量结果之间相关性低以及许多问题缺乏变异性,这表明表面上的可靠性通常是由于问题多样性而非一致的表现。此外,观察到性能出现不明原因的下降,特别是Claude,这可能归因于搜索结果的变化或评分标准无法区分“未找到信息”与“将其与不相关数据混淆”。 AI
影响 凸显了AI搜索功能潜在的不可靠性,影响用户信任和AI驱动测量的有效性。
排序理由 对AI模型在特定测试中的性能进行分析。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →