实体
SQUALITY
SQUALITY
PulseAugur coverage of SQUALITY — every cluster mentioning SQUALITY across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
GraphRAG评估指标因评估工具不同而产生冲突结果
最近的一项分析强调,检索增强生成(RAG)方法的评估,特别是GraphRAG,根据评估工具的不同,可能得出截然不同的结论。当由LLM评估者进行评估时,GraphRAG表现出高度的全面性和多样性,但当使用ROUGE-2等指标与地面真实进行评分时,这些结果会逆转,普通RAG通常表现更好。同样,检索性能也因特定基准和所用指标的不同而有显著差异,某些方法在事实检索方面表现出色,而另一些方法在复杂推理方面表现出色。这些方法的成本也显示出巨大的差…
-
GRADRAG框架通过跨组件提示适配增强多智能体RAG系统
研究人员开发了GRADRAG,一个旨在改进使用多个大型语言模型(LLM)智能体的检索增强生成(RAG)系统的新框架。与先前独立优化RAG组件的方法不同,GRADRAG将整个流程建模为一个计算图。它使用一个评估器来批判输出并提供反馈,然后提示优化器利用这些反馈迭代地优化检索器和回答器等上游智能体。这种协调的方法在LLM评判的SQUALITY和QMSum基准测试中,相比基线实现了12-15个百分点的净偏好优势,显示出显著的改进。