研究人员开发了在大型语言模型生成答案之前就能检测其对实体不熟悉的方法。通过对四个波兰 Bielik 模型进行激活离散度测量,他们发现内部信号可以准确地区分已知、晦涩和虚构的实体。然而,这种对熟悉度的内部认知并不直接与事实可靠性相关,事实可靠性随模型规模的增大而显著提高,并且模型很少回避回答。 AI
影响 这项研究提出了一种识别大型语言模型与不熟悉实体相关的幻觉的潜在方法,这可能带来更可靠的 AI 系统。
排序理由 学术论文,详细介绍了关于大型语言模型行为的新研究发现。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →