PulseAugur
实时 12:18:53
实体 natural-language explanations

natural-language explanations

PulseAugur coverage of natural-language explanations — every cluster mentioning natural-language explanations across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_200123 ·

    新框架为大语言模型特征生成自然语言解释

    研究人员开发了SAEVerbalizer,一个旨在为从大语言模型(LLMs)中提取的稀疏自编码器(SAEs)特征生成自然语言解释的新框架。目前解释SAE特征的方法通常肤浅且计算效率低下。SAEVerbalizer通过将SAE解码器方向注入LLM的表示中,并对模型进行微调以直接从这些方向生成解释来解决这一问题。实验表明,这种方法能有效地泛化到新特征,跨不同的SAE字典进行迁移,并可适配用于各种LLMs。