一项新研究表明,像Google Gemini 3.0 Pro这样的大型语言模型在规模化检测种植文档污染时,会表现出显著的性能下降和幻觉。虽然在单文档级别有效,但当处理大批量文档时,模型识别错误的能力会急剧下降,导致捏造虚假污染物。研究强调,与荒谬的插入相比,大型语言模型在检测拼写错误和语义反转等合理错误方面能力较弱,这表明需要增强基于大型语言模型的审计系统的验证机制和有界批量处理。 AI
影响 突出了大型语言模型在自动化审计任务中可靠性的关键限制,并暗示了在需要高精度应用中存在的潜在风险。
排序理由 学术论文,详细介绍研究结果。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →