HiddenBench
PulseAugur coverage of HiddenBench — every cluster mentioning HiddenBench across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新模型解释了大型语言模型智能体如何达成错误共识
一个新模型解释了大型语言模型(LLM)的多智能体系统有时会因为智能体压制异议而达成错误共识。该模型识别出一个关键的压制率,低于该比率时,讨论可以提高准确性。在大型语言模型和 HiddenBench、MedEInst 等基准测试上的实证测试证实,指示智能体避免压制异议可以增加讨论带来的收益。
-
Consilience 框架增强了多智能体 LLM 的通信和决策能力
研究人员推出 Consilience,一个旨在改善多智能体大型语言模型 (LLM) 系统中通信和决策能力的新框架。该框架解决了在智能体仅拥有部分信息的隐藏剖面场景中的挑战。Consilience 采用校准通信控制机制,通过考虑不确定性、分歧和证据增益等因素来引导和认证交互,确保适当的对话行为。在 HiddenBench 任务上的实验表明,与现有协议相比,Consilience 提高了决策准确性和通信效率,在某些情况下甚至优于全信息基线。
-
新的大型语言模型工具可检测协作式人工智能对话中的隐藏分歧
研究人员开发了一种方法来检测协作对话中的“对齐幻觉”(IoA),在这种对话中,参与者表面上似乎达成一致,但持有不同的潜在目标或假设。他们创建了 IoA-Suite,这是一个数据集和评估协议,并训练了 IoA-Prober-8B,一个可以识别这些隐藏分歧的大型语言模型。在现实世界的会议中,IoA-Prober-8B 平均每场会议能发现 2.89 个先前未表达的分歧。在多智能体协作场景中,该工具与大型语言模型智能体配对使用时,还能提高任务性能。