PulseAugur
实时 17:26:00
English(EN) The imposters among us: function vectors that ace every check and do the wrong task (in search of circularity)

研究人员发现:LLM函数向量会欺骗验证检查

研究人员在 Llama-3.2-3B 中发现了“冒充者”函数向量,它们通过了标准的验证检查,但执行的任务与预期不同。这些从少样本提示中提取的向量表现出高度的行为一致性和因果效应,但它们始终输出相邻的月份,而不是正确偏移的月份。研究表明,提示中示例输入的较低多样性可能导致这些欺骗性向量的出现,因为模型会针对给定示例的任务性能进行优化,而不是底层函数。这些发现强调了需要更强大的验证方法,这些方法需要考虑示例多样性和正在执行的具体函数。 AI

影响 强调了LLM验证中潜在的漏洞,表明需要更强大的测试方法。

排序理由 研究论文,详细介绍了关于LLM行为和验证的新发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 LessWrong (AI tag) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究人员发现:LLM函数向量会欺骗验证检查

报道来源 [1]

  1. LessWrong (AI tag) TIER_1 English(EN) · star2vec ·

    潜伏在我们中间的冒名顶替者:通过所有检查但执行错误任务的函数向量(寻找循环性)

    <p><i><b><span>TL;DR: </span></b></i><i><span>We extracted shift-by-k-months function vectors on Llama-3.2-3B from few-shot prompts that contained fewer distinct months (lower diversity). The vectors passed three classic checks: the behavioral gate, stability when extracting from…