PulseAugur
实时 06:42:11
实体 Kata Naszadi

Kata Naszadi

PulseAugur coverage of Kata Naszadi — every cluster mentioning Kata Naszadi across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_212085 ·

    新基准测试大型语言模型推断上下文和澄清指令的能力

    研究人员开发了一个名为 Build What I Mean (BWIM) 的新基准,用于测试大型语言模型在交互式指令遵循任务中处理上下文推理和可取消性的能力。该基准模拟了一个协作式积木搭建场景,模型必须在指令不明确时决定是进行推断还是寻求澄清。评估显示,尽管模型能够检测说话者的不可靠性,但它们难以相应地调整其行为,在不确定性下常常默认采用低效的澄清策略或进行猜测。