HotpotQA
PulseAugur coverage of HotpotQA — every cluster mentioning HotpotQA across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新的 Pleias-RAG 模型为小型 LLM 提供引用和事实依据
研究人员推出了 Pleias-RAG 模型家族,该家族包含用于检索增强生成 (RAG)、搜索和来源摘要的小型推理模型。这些模型 Pleias-RAG-350m 和 Pleias-RAG-1B 在模拟多语言开源检索的合成数据集上进行了中等训练。它们提供对引用和字面引用事实依据的原生支持,以及查询路由和来源重排等功能。与 Qwen 2.5 7B 和 Llama-3.1 8B 等大型模型相比,这些模型在 RAG 基准测试中的表现优于其他小型…
-
UNREAL模型统一检索与长上下文证据选择
研究人员推出UNREAL,一个将检索增强生成(RAG)和长上下文推理统一在单一模型中的新框架。该方法利用冻结的LLM内部表示,跨越从长提示到整个语料库的各种尺度选择证据。UNREAL仅添加了最少的训练参数,并在HotpotQA和2WikiMultiHopQA等基准测试中显著提高了召回率,同时还提高了长上下文任务的准确性并降低了计算成本。
-
RAGFlip论文衡量检索器升级中的负面翻转
一项新的研究论文RAGFlip引入了一种评估检索器升级的方法,重点关注查询级负面翻转。当新的检索器未能找到先前检索器(如BM25)成功识别的相关段落时,就会发生这种翻转。研究发现,所有评估的替换检索器(BGE-large、E5-large-v2和SPLADE)都提高了整体覆盖率,但在各种数据集和深度上仍然表现出负面翻转。这些回归尤其在较小的检索深度下更为显著,突显了在检索器评估中,除了聚合指标外,还需要查询级兼容性。
-
新的 Hop-Decayed Influence 攻击目标是 GraphRAG 管道
一种名为 Hop-Decayed Influence (HDI) 的新攻击向量已被识别,它利用了 GraphRAG 管道的辅助结构中的漏洞。该攻击针对的是模式级别(schema-level)的组件,而不是单个节点或边,通过在索引后破坏这些结构来获得高成功率。HDI 攻击表现出显著的放大效应,少量修改即可影响大量查询,并且通过保持语言上的连贯性来规避当前防御措施。
-
新研究表明,LLM代理通过工具拒绝信号得到改进
一篇新的arXiv论文探讨了当检索工具不提供相关信息时,被称为“冷冻代理”的大型语言模型如何反应。研究人员发现,一个简单的、未宣布的拒绝信号显著提高了Qwen3和Claude Haiku 4.5等模型的弃权率(针对无法回答的问题),从而大大减少了错误答案。研究还强调,拒绝信号的措辞会影响代理行为,解释比纯粹的标记或软警告更有效。
-
新研究优化RAG评估预算以提升AI性能
一篇新研究论文探讨了代理检索增强生成(RAG)系统评估预算的最优分配。该研究使用HotpotQA和MuSiQue等数据集,表明优先考虑更广泛的问题覆盖而非更多的搜索轨迹或重复读取,可以显著降低错误率并提高效率。研究结果表明,在约3400万模型token的预算下,增加解决问题的数量与专注于轨迹深度或多次读取相比,能大幅降低标准误差。
-
新研究发现:AI子代理存在过度信任过时数据的风险
一篇题为“委托危险带”(The Delegation Danger Band)的新研究论文探讨了AI框架中的子代理过度依赖从父代理继承的过时信息的现象。该研究使用Qwen3模型系列在MuSiQue和HotpotQA等各种数据集上进行,发现中等能力的子代理特别容易受到这种“危险带”的影响,与使用全新状态的对应代理相比,其性能显著下降。研究表明,虽然经过精心策划的状态传递可以提高准确性,但需要一个可转移的路由器来预测在重用过去信息和避免过…
-
研究质疑理性陈述在AI问答系统中的有效性
一篇新发表在arXiv上的研究调查了角色专业化问答(QA)流程中理性陈述的沟通有效性。研究人员发现,尽管理性陈述并未显著提高答案的准确性,但它们严重影响了验证者对支持的评估。特别是被篡改的理性陈述,会极大地改变支持判断,并可能导致过度信任,即使人类会拒绝它们。研究结果表明,理性陈述的共享应被视为一种验证机制,而不是提高答案准确性的直接途径。
-
Laya-compactor 将 RAG 上下文令牌在本地减少 70%
Laya-compactor 是一款新的开源工具,旨在减少检索增强生成 (RAG) 管道中发送到大型语言模型的令牌数量。它通过在本地对检索到的文档进行评分和过滤来实现这一点,只保留最相关的文档,并将令牌数量减少高达 70%,而不会影响 SQuAD 和 HotpotQA 等基准测试的答案质量。该工具提供 Python API,并与 LangChain 和 LlamaIndex 等流行框架集成,为基于 API 的决策模型提供免费替代方案。
-
保形事实性控制增强了多跳RAG,但降低了输出。
研究人员探讨了保形事实性控制在多跳检索增强生成(RAG)系统中的有效性。他们的研究应用于HotpotQA、Natural Questions和TriviaQA等数据集,并使用了Llama-3.1:8b和GPT-4o mini等模型。研究发现,分裂保形声明过滤显著增加了生成声明的事实支持。然而,这种改进是以降低声明保留率和提高弃权率为代价的,这意味着保留的声明更少,更多的响应变为空白。
-
AI预训练和中期训练增强奖励适应性
研究人员探讨了预训练和中期训练如何促进AI模型有效适应奖励。他们的研究描述了在训练奖励上达成一致但可能导致新输入结果不同的机制。他们证明了与任务无关的源观察对于解决这种歧义至关重要。使用预训练的Qwen2.5检查点在八个世界进行的实验表明,使用正确的源和首次操作监督训练的序列模型,与对照组相比,成功率显著提高,这突显了信息获取和奖励指导学习之间的分工。
-
新模型通过时间有效性和显式概念溯源增强大型语言模型
研究人员引入了概念生命周期模型(CLM)和概念导向注意力(CGA),以增强知识密集型语言模型。CLM将概念表示为具有显式溯源的持久性、时间版本化的实体,而CGA将图结构注入Transformer计算中。在MuSiQue和HotpotQA等数据集上的评估表明,虽然图注意力机制并未显著提高证据召回率,但显式时间表示将答案准确率提高了多达25个百分点。该框架还通过明确表述认知状态,显著减少了不支持的断言。
-
抽象预训练提升LLM推理能力,超越困惑度
一篇新论文探讨了抽象预训练对语言模型的影响,证明即使少量抽象数据也能显著提高推理能力,而不会影响困惑度。研究发现,使用堆栈操作任务进行预热,该任务需要组合和状态跟踪能力,在MUSIQUE、HOTPOTQA和2WIKIMULTIHOPQA等数据集的多跳问答方面取得了显著的提升。研究表明,这种抽象训练的结构和时机对其有效性至关重要,并且在后续的自然语言预训练中仍然具有益处。
-
抽象预预训练提升语言模型推理能力和效率
研究人员正在探索超越标准困惑度指标的语言模型新颖预预训练技术。一项研究表明,即使困惑度相当,在抽象、堆栈操作任务上进行的简短预热也能显著提高小型模型的“多跳问答”能力。另一项跨越不同规模和数据混合的综合研究证实,“预预训练”(PPT)在合成数据上可以提高令牌效率和下游性能,特别是通过改进长距离检索而非语法先验。
-
PANDA架构提升多智能体系统可扩展性和容错能力 · 跟踪2个来源
研究人员推出了一种新颖的去中心化架构PANDA,旨在增强由大型语言模型驱动的大规模多智能体系统(MAS)的可扩展性和容错能力。PANDA通过使智能体能够发现能力、自我组织成专业团队以及高效管理通信,解决了现有MAS的局限性。该架构支持灵活的编排策略和动态重新规划以从故障中恢复,确保任务完成。在HotPotQA基准上的评估表明,PANDA可扩展到数千个智能体,实现高效率,并在故障条件下保持性能。
-
新的STITCH-RAG框架增强了AI生成的多跳检索能力
研究人员推出了一种名为STITCH-RAG的新型框架,旨在改进多跳检索增强生成。该系统利用超图来编码主题参与和实体状态,解决了现有基于块和成对检索方法的局限性。STITCH-RAG包含一个时空影响桥接传播机制,并使用连续分数来增强局部个性化PageRank,从而提高了在HotpotQA和2WikiMultiHopQA等基准测试上的准确性。
-
探索LoRA适配器KV缓存重用以平衡质量与服务成本
研究人员调查了在共享骨干模型中跨多个LoRA适配器重用KV缓存时,保持任务质量与降低服务成本之间的权衡。他们在Qwen3-1.7B模型上进行了实验,使用了用于抽取式问答和算术推理的适配器,结果表明,完全重用前缀可将预填充成本降至最低,但会在保留数据上导致质量略有下降。部分重新计算并未提供显著优势,封闭形式的KV翻译器也表现不如直接重用。虽然随着上下文长度的增加,热缓存的首个标记时间得到了显著改善,但由于实现细节,并未实现实际的内存节省。
-
Mosaic 框架通过查询感知探索策略增强 GraphRAG
研究人员推出 Mosaic,一个新颖的框架,旨在通过按查询自适应探索策略来增强图检索增强生成(GraphRAG)。与使用统一探索策略的现有系统不同,Mosaic 将检索构建为一个控制问题,使 LLM 分析器能够根据特定查询需求定制种子选择、图遍历和证据收集的策略。这种方法在 GraphRAG-Bench 等基准测试中,尤其是在医学和通用知识领域,通过提高答案正确性和证据召回率,同时减少探索路径和保留证据的数量,展示了显著的改进。
-
新的RAG框架通过对比证据探索增强多跳问答 · 跟踪2个来源
研究人员开发了一种新的多跳问答框架,通过解决现有单次查询扩展方法的局限性来改进检索增强生成(RAG)。这种无需训练的方法集成了证据条件探索、段落特定对比精炼和覆盖感知排序,以更好地发现复杂推理所需的中间实体和关系。在MuSiQue、HotpotQA和2WikiMultiHopQA等基准数据集上的实验表明,检索质量和下游问答性能均有显著提高。
-
查询重写与RAG结合可提升性能,研究发现
一篇新的研究论文探讨了用于增强检索增强生成(RAG)系统的查询重写技术。研究发现,结合多种重写策略,以及像HyDE和Query2Doc这样的强大基线,可以显著提高在企业数据集上的性能,使HIT@10提高12个百分点以上。研究人员还开发了一种置信门控路由器,可以选择性地应用重写以降低成本,同时保持显著的收益,F1分数提高了近2个百分点。