PulseAugur
中
实时 20:21:02
实体 HiddenBench

HiddenBench

PulseAugur coverage of HiddenBench — every cluster mentioning HiddenBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_273440 ·

    新模型解释了大型语言模型智能体如何达成错误共识

    一个新模型解释了大型语言模型(LLM)的多智能体系统有时会因为智能体压制异议而达成错误共识。该模型识别出一个关键的压制率,低于该比率时,讨论可以提高准确性。在大型语言模型和 HiddenBench、MedEInst 等基准测试上的实证测试证实,指示智能体避免压制异议可以增加讨论带来的收益。

  2. TOOL · CL_215863 ·

    Consilience 框架增强了多智能体 LLM 的通信和决策能力

    研究人员推出 Consilience,一个旨在改善多智能体大型语言模型 (LLM) 系统中通信和决策能力的新框架。该框架解决了在智能体仅拥有部分信息的隐藏剖面场景中的挑战。Consilience 采用校准通信控制机制,通过考虑不确定性、分歧和证据增益等因素来引导和认证交互,确保适当的对话行为。在 HiddenBench 任务上的实验表明,与现有协议相比,Consilience 提高了决策准确性和通信效率,在某些情况下甚至优于全信息基线。

  3. TOOL · CL_193319 ·

    新的大型语言模型工具可检测协作式人工智能对话中的隐藏分歧

    研究人员开发了一种方法来检测协作对话中的“对齐幻觉”(IoA),在这种对话中,参与者表面上似乎达成一致,但持有不同的潜在目标或假设。他们创建了 IoA-Suite,这是一个数据集和评估协议,并训练了 IoA-Prober-8B,一个可以识别这些隐藏分歧的大型语言模型。在现实世界的会议中,IoA-Prober-8B 平均每场会议能发现 2.89 个先前未表达的分歧。在多智能体协作场景中,该工具与大型语言模型智能体配对使用时,还能提高任务性能。