PulseAugur
实时 12:00:00
实体 Language Model Interpretability

Language Model Interpretability

PulseAugur coverage of Language Model Interpretability — every cluster mentioning Language Model Interpretability across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_206199 ·

    新的 CHIVE 系统通过反事实实验评估 LLM 解释

    研究人员开发了 CHIVE,一个新颖的代理式管道,旨在通过反事实提示编辑来识别和调查大型语言模型 (LLM) 的意外行为。该系统生成数千种自然发生的模型行为的解释,并辅以反事实证据。初步实验显示,常见的 LLM 可解释性技术并未提高代理预测反事实模型行为的能力。然而,在 CHIVE 生成的反事实实验数据上训练模型,证明了其在各种分布外设置中的泛化能力,这表明了一种改进 LLM 解释能力的新方法。