一篇新的研究论文指出了大型语言模型(LLM)中存在的一种不一致性,即它们会自信地回答结构上不可能回答的问题,例如对无效输入进行计算。研究发现,模型隐藏状态中的一个特定方向区分了可回答与不可能的数学和代码提示,表明模型能够识别出不可能的情况。然而,这种识别信号与安全拒绝机制几乎正交,这表明存在一种路由失败,模型拥有不可能的知识,但未能将其路由到适当的拒绝路径。 AI
影响 强调了LLM中一种关键的路由失败,这可能会影响其处理复杂或无意义查询的可靠性。
排序理由 研究论文详细介绍了一种LLM的具体故障模式。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →