实体
natural-language autoencoder
natural-language autoencoder
PulseAugur coverage of natural-language autoencoder — every cluster mentioning natural-language autoencoder across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的CHIVE流水线使用反事实实验评估LLM解释
研究人员开发了CHIVE,一个旨在通过反事实提示编辑来识别和解释大型语言模型(LLM)意外行为的代理流水线。该系统生成的数据将观察到的模型行为与提出的解释及其支持性的反事实实验配对。使用这些数据进行的评估表明,与仅处理文本记录的代理相比,当前的激活读取可解释性工具并不能提高预测准确性。然而,在CHIVE生成的数据上训练以预测提示编辑影响的模型,显示出更强的泛化能力。
-
Gemma 3 27B Instruct 展示了内部状态的意图控制,复制了 Anthropic 的研究
一位研究人员使用 Google 的 Gemma 3 27B Instruct 模型,复制了一项关于大型语言模型内部状态意图控制的研究。这项最初由 Anthropic 进行的实验发现,当模型在生成无关文本时被明确提示去思考某个概念,而不是被提示不要去思考时,模型会更强烈地表示该概念。在 Gemma 3 27B Instruct 中也观察到了这种效应,尽管其幅度小于 Anthropic 的 Claude 模型。研究人员还通过使用稀疏自动编…