研究人员开发了合成网络基准,这是一个旨在测试语言代理对错误信息易感性的新环境。该基准具有程序生成的超链接文章,并带有可信度和事实性的地面真实标签,可以隔离对抗性排名漏洞。对六个前沿模型的初步测试显示,即使可以访问真实来源,当暴露于一篇高可信度错误信息文章时,准确性会显著下降且校准失准。这些发现突显了当前模型处理冲突信息的基本局限性,并强调在高风险应用中需要更强大、更具认知谦逊性的代理。 AI
影响 强调了前沿模型在处理错误信息方面的关键漏洞,有必要为高风险领域开发更强大的代理。
排序理由 介绍用于评估 AI 模型安全性的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →