一位用户测试了多个 Claude AI 模型,包括 Opus、Fable、Sonnet 5 和 Haiku,以了解当面对超出其训练数据截止日期的问题时,它们能多有效地利用网络搜索工具。Opus 表现强劲,在 80 次中有 79 次做出了正确决定,而 Sonnet 5 和 Haiku 在获得使用搜索工具的明确指示后表现有所改善。测试还显示,一些模型,如 Fable 和 GPT-5.6 Luna,即使在可用搜索功能的情况下,也表现出虚构或保留过时信息的情况。 AI
影响 突出了 LLM 中网络搜索集成效果的差异以及系统提示对准确性的影响。
排序理由 用户进行的 AI 模型能力基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →