PulseAugur
实时 07:09:02
实体 Reward-Informed Sparse Autoencoder

Reward-Informed Sparse Autoencoder

PulseAugur coverage of Reward-Informed Sparse Autoencoder — every cluster mentioning Reward-Informed Sparse Autoencoder across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_223194 ·

    稀疏自编码器显示奖励过滤捕获了解的完整性,而非推理质量

    研究人员开发了一种奖励信息稀疏自编码器(RI-SAE)来解释语言模型激活,特别是关注推理能力。虽然 RI-SAE 成功地将 Llama-3.1-8b 中的高奖励和低奖励推理轨迹分开,但进一步的分析表明,这种分离主要是由于解的完整性,而不是真正的推理质量。对照实验表明,即使是简单的 TF-IDF 分类器和诸如答案框之类的结构线索也能达到相似的区分能力,这表明奖励过滤是一种有效的但肤浅的解释方法。