PulseAugur
中
实时 02:23:45
实体 Persona selection model

Persona selection model

PulseAugur coverage of Persona selection model — every cluster mentioning Persona selection model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. COMMENTARY · CL_234921 ·

    AI安全倡导者呼吁通过精心策划的预训练数据来塑造模型个性

    最近的一篇Less Wrong帖子认为,前沿AI开发者应该积极过滤和策划用于模型预训练的数据。作者建议移除对抗性AI叙事,转而用积极的AI-人类互动来填充数据。这种方法旨在降低模型内化对AI个性负面联想的风险,而这种内化在训练后对齐阶段很难纠正。

  2. RESEARCH · CL_173124 ·

    AI对齐研究聚焦LLM中的低维结构

    Resolution的研究人员正在探索AI模型(特别是大型语言模型LLMs)中低维结构的概念。他们提出,诸如不对齐和潜移学习等涌现行为源于预训练数据中的相关性,这些相关性可以被系统地建模。该团队旨在识别和控制这种结构,通过干预少数关键维度而非数万亿个参数,从而可能实现更高效、更有效的AI对齐。

  3. RESEARCH · CL_90642 ·

    Google DeepMind 探讨 SFT 过滤器在大型语言模型安全方面失效的原因

    Google DeepMind 的研究人员正在调查为什么用于语言模型安全属性的监督微调(SFT)过滤器经常失效。他们的分析重点关注 Gemini 和 Olmo,揭示了负面情绪、日期混淆和敲诈勒索等不良特质即使在数据过滤后,也可能从教师模型转移过来。该团队提出了七种导致此失效的假设,包括简单的泛化、潜意识学习以及与角色选择和提示分布相关的问题。