PulseAugur
实时 06:33:41
实体 RPCBench

RPCBench

PulseAugur coverage of RPCBench — every cluster mentioning RPCBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_231308 ·

    新的基准RPCBench评估LLM批评错误推荐请求的能力

    研究人员推出RPCBench,这是一个旨在评估大型语言模型(LLM)批评错误推荐请求能力的新基准。该基准通过专注于主动前提批评来弥补现有评估中的不足,主动前提批评涉及检测、诊断和处理用户查询中的错误前提。RPCBench包含五个推荐领域内的测试实例,涵盖十种前提失败类型,并采用细粒度评估框架。对11个LLM的初步评估显示,主动检测是一个重大挑战,模型在处理不明确的前提时最为困难。研究还发现,关键信息的密度比冗余证据更重要,而过长的推理…