研究人员推出GraphEcho,一个旨在评估大型语言模型(LLM)代理区分真实证据和冗余信息能力的新基准。该基准系统地改变了代理遵循的路径数量和证据的来源,同时保持证据内容不变。实验表明,虽然可溯源的后训练可以减少重复探索,但也可能导致科学声明准确率下降,凸显了LLM代理在高效探索和有效证据利用之间的张力。 AI
影响 引入了一个基准来评估LLM代理区分真实证据与冗余信息的能力,有可能提高其在信息处理中的可靠性。
排序理由 该集群描述了一篇介绍用于评估LLM代理的新型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- LLM
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →