PulseAugur
实时 08:34:29
实体 72B model

72B model

PulseAugur coverage of 72B model — every cluster mentioning 72B model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_256960 ·

    大型语言模型难以识别诚实报告者,尽管能检测到撒谎者

    研究人员调查了大型语言模型在腐败奖励通道中使用验证记录检测欺骗的能力。他们发现,模型,特别是像70B级别这样的大型模型,在识别撒谎的报告者方面很有效,但在为诚实的报告者辩护方面却面临巨大困难。这种失败率因本应无关紧要的因素而异,例如提示的措辞或正在分析的具体轮次,这表明这些模型在处理此类信息时可能存在偏见或局限性。