研究人员开发了一种名为匹配轨迹回放的新协议,用于评估语言模型代理如何使用置信信号来决定在回答前是否检索额外信息。该方法控制了候选答案状态和证据点等变量,以比较不同的置信度到行动的映射。使用 Mistral、GPT 和 Qwen 模型在问答数据集上的实验表明,虽然校准可以提高准确性并使承诺风险可解释,但它不一定能估计进一步检索的好处,有时还会降低覆盖率或增加检索使用。 AI
影响 这项研究通过改进 AI 代理评估外部信息需求的方式,有望带来更可靠、更可解释的决策。
排序理由 该集群包含一篇详细介绍语言模型代理新评估协议的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →