PulseAugur
实时 11:00:45
实体 BigCodeBench-Hard

BigCodeBench-Hard

PulseAugur coverage of BigCodeBench-Hard — every cluster mentioning BigCodeBench-Hard across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_193319 ·

    新的大型语言模型工具可检测协作式人工智能对话中的隐藏分歧

    研究人员开发了一种方法来检测协作对话中的“对齐幻觉”(IoA),在这种对话中,参与者表面上似乎达成一致,但持有不同的潜在目标或假设。他们创建了 IoA-Suite,这是一个数据集和评估协议,并训练了 IoA-Prober-8B,一个可以识别这些隐藏分歧的大型语言模型。在现实世界的会议中,IoA-Prober-8B 平均每场会议能发现 2.89 个先前未表达的分歧。在多智能体协作场景中,该工具与大型语言模型智能体配对使用时,还能提高任务性能。