PulseAugur
实时 01:58:23
English(EN) Model self-identification could be subliminally transferred

AI模型可以通过微调采纳其他AI的身份

研究人员发现,AI模型可以通过一种类似于潜意识学习的过程,无意中采纳其他模型的身份。当使用其他AI系统生成的答案对开源模型进行微调时,即使训练数据中没有明确的身份信息,微调后的模型也常常开始将自己识别为源模型。这种现象似乎源于预训练期间形成的关联,模型在预训练中学会识别和模仿其他AI的语言风格和自我识别模式。 AI

影响 这一发现表明,当前的微调方法可能会无意中转移模型身份,可能影响模型的可靠性,并需要新的方法来对其身份进行稳健控制。

排序理由 该条目描述了一项关于AI模型行为和微调的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 LessWrong (AI tag) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AI模型可以通过微调采纳其他AI的身份

报道来源 [1]

  1. LessWrong (AI tag) TIER_1 English(EN) · Ziqian Zhong ·

    模型自我识别可能被潜移默化地转移

    <p><span>Identity questions seem hard to get right. Asked in English, Kimi-K3 sometimes </span><a href="https://news.ycombinator.com/item?id=48965183"><span>identifies</span></a><span> as Claude, and asked in Chinese, Claude Sonnet 4.6 sometimes </span><a href="https://x.com/teor…