PulseAugur
实时 11:04:11
实体 CoCoEval

CoCoEval

PulseAugur coverage of CoCoEval — every cluster mentioning CoCoEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_247732 ·

    新框架揭示LLM难以模拟不一致的人类行为

    一个名为CoCoEval的新评估框架已被开发出来,用于评估大型语言模型(LLMs)在模拟人类社交互动方面的能力,特别关注不一致和不合作行为。研究人员发现,当前的LLMs,如GPT-4.1、GPT-5.1和Claude Opus 4,表现出此类行为的频率远低于人类,并且提示工程和微调并不能可靠地弥合这一差距。该研究对LLMs作为真实人类社交动态代理的准确性提出了担忧。