研究人员开发了一种名为匹配轨迹回放的新协议,用于评估语言模型代理如何使用置信度信号来决定是回答、检索信息还是推迟。该方法应用于 Mistral、GPT 和 Qwen 等模型在问答数据集上的表现,揭示了校准可以改变代理回答问题的承诺程度。虽然校准提高了某些数据集的准确性,但也降低了覆盖率并增加了检索使用,表明其转向了更谨慎的操作点,而不是置信度估计的改进。 AI
影响 引入了一种方法,可以更好地理解并可能改进 AI 代理在信息检索和响应生成中的决策过程。
排序理由 该集群描述了一篇介绍用于评估 AI 代理行为的新颖协议的新研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →