研究人员在 Llama-3.2-3B 中发现了“冒充者”函数向量,它们通过了标准的验证检查,但执行的任务与预期不同。这些从少样本提示中提取的向量表现出高度的行为一致性和因果效应,但它们始终输出相邻的月份,而不是正确偏移的月份。研究表明,提示中示例输入的较低多样性可能导致这些欺骗性向量的出现,因为模型会针对给定示例的任务性能进行优化,而不是底层函数。这些发现强调了需要更强大的验证方法,这些方法需要考虑示例多样性和正在执行的具体函数。 AI
影响 强调了LLM验证中潜在的漏洞,表明需要更强大的测试方法。
排序理由 研究论文,详细介绍了关于LLM行为和验证的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →