HotpotQA
PulseAugur coverage of HotpotQA — every cluster mentioning HotpotQA across labs, papers, and developer communities, ranked by signal.
- instance of alphaXiv 90%
- instance of ScienceCast 90%
- instance of 2WikiMultiHopQA 70%
- instance of Musique 70%
- instance of CatalyzeX 70%
- used by Gotit.pub 70%
- competes with Gepa Ai Agent 70%
- used by Fever 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- used by 2WikiMultiHopQA 70%
- used by Gepa Ai Agent 70%
18 天有情绪数据
-
研究发现:边缘RAG系统可通过自适应压缩节省能源
一项新的研究论文探讨了面向边缘设备的检索增强生成(RAG)系统的自适应压缩技术。该研究在NVIDIA Jetson AGX Thor上进行,证明了根据工作负载和设备遥测数据动态调整压缩率,可以在不影响输出质量的情况下显著降低能耗。研究结果表明,中间压缩级别可以将GPU和SoC的能源使用量降低50%以上,比静态或离线压缩方法提供了更有效的方法。
-
新的检索方法DBRR在固定预算内改进证据恢复
研究人员推出了一种新颖的检索方法——双边界关系检索(DBRR),旨在在固定预算内增强信息恢复能力。DBRR将检索资源分配给初始相关性排序的种子和相关的上下文信息,超越了标准的Top-K排序。通过利用证据项之间的关系,该方法在恢复问题的完整支持证据集方面表现出显著的改进,尤其是在复杂的“桥接”问题类型中。
-
新方法使用代理搜索轨迹调整密集检索模型
研究人员开发了导航感知嵌入(NIE),一种利用代理搜索工作流中的轨迹来调整密集检索模型的新方法。该方法利用查询、检索和停止轨迹来微调已部署的模型,而无需新的相关性标签、合成查询或 LLM 判断。通过将停止文档视为正面示例并纳入先前的路径文档,NIE 显著提高了检索性能,在 BEIR HotpotQA 等基准测试中,Recall@20 提高了高达 5.8 个点,nDCG@10 提高了 1.9 个点。
-
LineageRAG 通过构建明确的证据链增强GraphRAG · arXiv
研究人员推出了一种名为LineageRAG的新方法,通过显式构建证据链来增强基于图的检索增强生成(GraphRAG)。该方法将证据发现与源头依据联系起来,确保检索到的每条证据都与其原始需求和来源相关联。在HotpotQA、2WikiMultiHopQA和MuSiQue等基准数据集上的实验表明,与现有的GraphRAG基线相比,LineageRAG显著提高了检索和答案提取指标。
-
Noesis架构通过自适应并行和语义发现增强了Graph-RAG
研究人员推出了一种新颖的Graph-RAG架构Noesis,旨在克服当前系统的局限性。Noesis采用四种算法来解决静态分块、自适应扩展和多领域部署的挑战。该系统在速度和效率方面取得了显著改进,在零内存溢出事件的情况下实现了23倍的速度提升,并在消费级GPU上实现了6.3倍的速度提升,同时在HotpotQA基准测试中也超越了现有方法。
-
Noesis架构通过自适应并行和跨知识库路由增强Graph-RAG · 跟踪2个来源
研究人员推出了一种新颖的Graph-RAG架构Noesis,旨在克服将大型语言模型与领域特定知识进行基础化的局限性。Noesis采用了四种关键算法:用于模拟人类阅读的双向图遍历、用于实现23倍加速的自适应扩展的AIMD并发控制器、用于提供消费级GPU上6.3倍加速的领域感知量化的Moesis,以及用于跨知识库语义路由的Mesh。该系统在HotpotQA基准测试中表现出显著的改进,达到了59.5 EM / 74.7 F1,比现有的Gra…
-
新框架通过优化推理和翻译增强多跳问答能力
两篇新研究论文 IterCOMP 和 Syfer 推出用于改进多跳问答系统的新颖框架。IterCOMP 专注于面向推理的自适应提示压缩,以减少检索增强生成中的噪声并提高效率。Syfer 通过优化翻译和查询分解来解决多语言多跳问答问题,在管理计算成本的同时保持准确性。这两种方法在基准数据集上都显示出显著的改进。
-
新的 RAG 方法在保持准确性的同时减少了检索调用
研究人员开发了一种新的多轮检索增强生成(RAG)系统方法,用于确定何时停止搜索信息。通过采用结构化充分性-差距判断方法,他们在冻结的 Search-R1 管道中训练了一个 Qwen3.5-2B 模型作为裁判。该方法在测试集上成功将检索调用减少了 3.70%,同时答案准确性仅略微下降了 0.625 个百分点。
-
EviReform 通过证据指导查询来改进多跳图检索
研究人员开发了 EviReform,一种用于多跳图检索的新颖方法,可提高查找相关段落的准确性。EviReform 根据最初检索到的证据重构检索请求,从而更精确地搜索补充信息。该方法在 2WikiMultiHopQA、HotpotQA 和 MuSiQue 等基准数据集上的表现显著优于现有基线,展示了改进的 Recall@5 和 F1 分数。
-
新研究探索用于自动提示优化的模块化和递归方法
两篇新研究论文介绍了优化大型语言模型提示的新方法。第一篇SAPO将提示分解为角色、上下文和任务等部分,从而进行有针对性的改进,以提高在各种基准测试中的性能。第二篇RLMOpt利用递归语言模型来驱动优化过程本身,从而在多个任务和基准测试中实现更高效、更有效的提示生成,其性能通常优于GEPA等现有方法。
-
新方法通过使用更便宜的模型处理大部分任务来优化LLM提示
研究人员开发了一种新颖的方法,通过解耦LLM的角色并利用跨层迁移来优化大型语言模型(LLM)的提示和代理程序。该方法涉及在更便宜的LLM层上运行大容量应答功能,同时为关键的反射和变异任务保留更强大的模型。该方法显著降低了搜索成本,在各种基准测试和模型系列中取得了与同层优化相当或更好的结果。
-
新的 EL-DGR 框架提高了 LLM 裁判在推理管道中的性能
一篇新研究论文介绍了一种用于推理管道中 LLM 裁判的新型决策框架——证据锁定派生-门控-修复 (EL-DGR)。该研究表明,通过限制 LLM 裁判的决策过程,EL-DGR 在 GSM8K 和 HotpotQA 等基准测试中显著提高了性能。该方法通过要求提供提取式证据证明来覆盖共识,而不是仅仅依赖裁判的准确性,从而限制了裁判的潜在错误。
-
新的RAG架构应对多跳推理和沟通对齐
两篇新的研究论文提出了大型语言模型检索增强生成(RAG)的改进。第一篇,SAG,引入了一种新颖的架构,将文档组织成一个事件-实体索引,从而实现动态的、查询范围内的邻域,以提高多跳推理和在HotpotQA和MuSiQue等基准上的QA性能。第二篇,TA-RAG,概念化了一个架构框架,该框架在事实准确性之外优先考虑沟通对齐,解决了上下文分离和共情框架失败等问题,尤其适用于社会敏感应用。
-
SAGE系统优化RAG检索以降低延迟和成本 · 跟踪2个来源
研究人员开发了SAGE,一种面向生产检索增强生成(RAG)系统的新型自适应检索策略。SAGE根据估计的查询难度动态调整每个查询检索到的文档数量,旨在满足延迟和成本方面的严格服务水平目标(SLO)。该系统使用初始检索的轻量级特征,并进行离线训练,在推理时增加的开销极小。实验表明,SAGE在各种数据集和LLM家族中,在保持答案质量的同时,显著提高了SLO合规性,并降低了延迟和成本,与静态基线相比。
-
新的HERALD系统审计AI搜索代理奖励是否存在操纵行为
研究人员开发了HERALD,一个旨在评估和改进搜索代理奖励机制的新型离线审计系统。HERALD使用反事实干预来区分候选可见信息和Oracle信息,旨在确保高分准确反映检索到的证据并防止操纵。在多个问答基准上对Qwen3_8B模型进行的初步测试表明,虽然HERALD可以检测到一些攻击,但引用洗白攻击仍然成功,这表明需要进一步加强奖励系统。
-
新研究揭示了大型语言模型提示压缩中的“引用悬空”故障
一篇新研究论文识别出一种用于大型语言模型(LLM)的硬提示压缩技术中的重大故障模式,称为“引用悬空”。当压缩过程保留了包含答案的文本但删除了解释答案的关键上下文时,就会发生这种情况。实验表明,该问题影响了包括GPT-5.5在内的各种数据集和模型中的大量示例,导致准确率下降高达34个百分点。研究人员提出了一种自动恢复被省略句子的方法,在不显著改变压缩率的情况下显著提高了准确率。
-
研究发现LLM幻觉基准具有误导性
对四种开源大语言模型——Phi-4 Mini、Mistral 7B Instruct v0.3、Qwen2.5-7B-Instruct 和 Llama-3.1–8B-Instruct 的最新分析显示,幻觉基准可能具有误导性。研究发现,超过一半的初始幻觉标签不正确,纠正这些标签后,模型的性能排名发生了显著变化。一个关键发现是,通过简单地拒绝回答就可以实现较低的幻觉率,因此在衡量模型可靠性时,必须将回答率与幻觉率一起考虑。
-
FLARE框架优化大语言模型指令,性能超越GEPA
研究人员推出了一种名为FLARE的新框架,旨在优化大语言模型的指令。FLARE利用先进的反射机制和有限的少样本参考示例集来提高在各种基准测试中的性能。在使用GPT-5系列模型进行评估时,FLARE在检索增强推理和情感分类等任务上持续优于GEPA优化方法,展现出显著的准确性提升,同时还表现出卓越的数据效率和稳定性。
-
引用悬空:LLM提示压缩中的一种新故障模式
一篇新论文识别出硬提示压缩技术中的一种重大故障模式,称为“引用悬空”。当旨在通过选择高分文本片段来减少上下文长度的方法无意中丢弃了理解保留文本所需的关键支持信息(如先行词或桥接事实)时,就会发生这种情况。在包括GPT-5.5在内的多个数据集和模型中都观察到了这个问题,当删除支持性上下文时,准确性会显著下降。研究提出,提示压缩应同时优化相关性和引用完整性,以维持模型性能。
-
新的数据集和框架旨在提高 LLM 问答的完整性
研究人员开发了新方法来提高大型语言模型 (LLM) 对复杂问题生成的答案的完整性和质量。Apple 的研究引入了 DeepAmbigQA,这是一个数据集和生成流程,旨在测试 LLM 在需要多跳推理和歧义实体消歧的问题上的表现,揭示即使是 GPT-5 等先进模型在答案完整性方面也存在困难。另外,一个名为 QQ 的新框架利用问题生成和回答的双重性质来创建更连贯的多跳问题,在 HotpotQA 和 MuSiQue 等数据集上显示出显著的改进。