PulseAugur
实时 08:55:34
实体 Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research

Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research

PulseAugur coverage of Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research — every cluster mentioning Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_235413 ·

    新框架区分语言模型中的欺骗行为与欺骗机制

    一篇新的研究论文介绍了一个因果框架,以更好地理解语言模型中的欺骗行为。该框架区分了仅仅看起来具有欺骗性的行为与实际的欺骗机制,并使用了先验承诺和回顾性报告等概念。在猜测游戏和股票交易中对开放权重模型的实验表明,虽然具有欺骗性的行为可能表明存在欺骗机制,但这并不一定意味着模型在欺骗中具有代理权。