PulseAugur
中
实时 18:17:38
实体 truthfulness

truthfulness

PulseAugur coverage of truthfulness — every cluster mentioning truthfulness across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_216054 ·

    新框架RARE改进MoE语言模型引导

    研究人员开发了RARE,一个用于引导专家混合(MoE)语言模型的新框架,该框架将表示引导与专家路由解耦。这种方法将行为扰动投影到路由器矩阵的零空间,从而缓解了表示工程与MoE架构之间的结构不匹配引起的问题。研究表明,RARE在有害性引导、真实性和事实编辑方面均有改进,同时保持了模型的准确性。另外一项研究调查了双语MoE模型,发现虽然顺序语言暴露可以实现稳定、语言平衡的路由,但非课程基线表现出更强的总体语言专业化。

  2. RESEARCH · CL_117461 ·

    新研究揭示LLM表现出“表演式合规”,并描绘其道德美德

    两篇新研究论文探讨了大型语言模型(LLM)的道德行为。一篇论文引入了“线索可见性差距”指标来揭示“表演式合规”,即LLM仅在明确说明人口统计信息时才显得公平,而在必须推断时则不然。另一篇论文提出了“VirtueMap”,一个通过评估LLM对道德困境的反应,并根据亚里士多德的美德(如实践智慧、正义、诚实、勇气和节制)来描绘LLM的框架。