Question Answering
PulseAugur coverage of Question Answering — every cluster mentioning Question Answering across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的MatRAG框架通过分层RAG和MRL增强多跳问答能力
研究人员开发了MatRAG,一个新颖的分层框架,它集成了检索增强生成(RAG)和俄罗斯套娃表示学习(MRL),以改进多跳问答系统。该方法将文档组织成一个具有递减粒度的有向无环图(DAG)的集群,并由较低的俄罗斯套娃维度进行索引。MatRAG通过避免昂贵的知识图谱构建和LLM摘要来降低索引和查询时间成本,同时通过维度感知相似性和实体驱动的跳数预算控制机制来提高检索质量。
-
新基准测试评估多模态大语言模型从密集图表中重建数值数据的能力
一项新的基准测试 ChartDensity-Bench 被引入,用于评估多模态大语言模型(MLLMs)从科学图表中重建数值数据的能力,特别是在高视觉密度条件下。该基准测试系统地改变了同时呈现的图表数量,以评估模型在结构可靠性、完整性、可解析性和数值保真度等方面的性能。初步实验表明,增加视觉密度通常会降低数值重建的准确性,并且不同 MLLMs 之间存在显著差异。
-
新框架Prompt2Skill通过自然语言指令优化LLM技能
研究人员开发了Prompt2Skill,一个新颖的框架,旨在仅使用自然语言指令为大型语言模型(LLMs)创建和优化技能。该方法通过自动推导任务规范、发现或合成数据集以及通过反思性编辑过程来完善技能,解决了专家编写技能的高成本和局限性。Prompt2Skill在包括问答、阅读理解、电子表格操作和数学推理在内的各种领域平均取得了10.8%的显著改进,在开源模型和前沿模型上均优于直接提示基线。
-
新的DRPG框架增强了持续的LLM改进
研究人员开发了一个名为动态检索策略生成(DRPG)的新框架,以应对大型语言模型(LLM)持续适应的挑战。DRPG集成了基于记忆的检索和一个动态策略生成器,利用历史数据和环境反馈来创建针对特定任务的LLM改进策略。该框架在文本到SQL、问答、医学诊断和Python编程等各种基准测试中,使用了多种专有和开源LLM,与现有基线相比,表现出了卓越的性能。
-
研究揭示了结合 AI 链接预测模型的局限性
一篇新发表在 arXiv 上的研究论文探讨了知识图谱中链接预测模型的收敛性和互补性。研究人员发现,尽管不同的模型捕捉了独特且互补的知识,但这种互补性会迅速饱和,即使使用大型模型集成,仍有很大一部分查询无法解决。该研究提出了一种“Oracle”方法来衡量模型互补性,突显了结合模型在增强 Web 应用方面的潜力和现有链接预测技术的根本局限性。
-
新的SCoNE方法提高了RAG模型对抗检索噪声的鲁棒性
研究人员推出了一种新颖的免训练方法SCoNE,旨在提高检索增强生成(RAG)模型在面对嘈杂检索信息时的鲁棒性。SCoNE选择性地编辑上下文感知的馈通网络神经元,识别那些既高度归属又表现出高跨输入变异性的神经元。该方法只需要少量的挖掘样本,并且不会增加推理时间的开销,在不同LLM骨干模型的知识密集型问答基准测试中,与基线方法相比,表现出了一致的性能提升。
-
ISO-RAG框架提升复杂问答的检索能力
研究人员推出了一种新颖的检索增强生成(RAG)框架ISO-RAG,以解决多跳问答中的局限性。通过利用双曲庞加莱圆盘模型,ISO-RAG能够修剪知识图谱中的噪声边,从而缩小搜索空间,提高检索的准确性和效率。实验表明,与现有方法相比,在检索召回率和下游精确匹配得分方面均有显著提升。
-
新研究通过证据充分性和查询精炼来应对多跳问答挑战 · 跟踪 5 个来源
两篇新研究论文解决了多跳问答系统中的挑战。第一篇《Learning Evidence Sufficiency Boundaries for Selective Answering in Grounded Multi-Hop QA》介绍了一个训练框架,帮助模型确定提供的证据是否足以回答问题,从而提高准确性并减少无根据的答案。第二篇论文《Hi-Q: Hierarchical Evidence-guided Query Refinement…
-
新的SelfGraphRAG框架通过合成数据改进知识图谱检索
研究人员开发了SelfGraphRAG,一个新颖的框架,旨在通过有效利用知识图谱来增强检索增强生成(RAG)。该方法通过直接从知识图谱的结构生成合成问答对,解决了监督图谱检索中标记数据有限的常见挑战。这些合成数据点能够训练一个条件查询图谱检索器,该检索器捕获多跳路径和局部邻域的关系监督。实验表明,SelfGraphRAG在检索精度和下游推理任务上优于现有的基于嵌入的基线,特别是在多跳问答和分类基准测试中。
-
新型重排器编排语音和文本以改进LLM检索
研究人员推出了一种名为STeReO的新型重排器,旨在管理检索增强生成(RAG)系统中的异构语音和文本检索数据库。该方法旨在通过有效聚合和选择来自不同数据源的相关证据来提高大型语言模型(LLMs)的准确性。为了克服专业训练数据稀缺的问题,我们整理了一个新的数据集来训练和评估STeReO,证明了其显著提升了问答性能。
-
指令调优影响LLM的置信度和推理多样性
一项新的研究论文调查了指令调优对大型语言模型的影响,特别考察了它如何影响模型的置信度和其生成推理的词汇多样性。研究发现,即使在预测准确性或校准方面只有微小改进的情况下,指令调优也能持续提高模型的置信度。此外,研究还观察到跨推理的多样性有所下降,并且对表面词汇多样性产生了不同影响,这表明置信度和推理多样性是指令调优的不同结果。
-
大语言模型不确定性量化研究探索校准以获得可靠答案
两篇研究论文探讨了提高大语言模型(LLM)生成答案可靠性的方法,特别是在问答任务中。第一篇论文介绍了 A-CRC-QA,这是一个事后校准框架,旨在通过将选择条件误差控制重新表述为线性期望约束来控制被接受答案中的错误率。第二篇论文实证研究了如何从词元概率中推导出数学问答的校准置信度估计,比较了单通道和多通道估计器,并评估了 Platt 缩放和等渗回归等事后校准方法。
-
RAG的根源可追溯至2000年初的信息检索研究,而非LLM
一篇新论文认为,检索增强生成(RAG),常被视为一种新颖的LLM范式,实际上深深植根于早期信息检索和问答研究。作者将RAG的核心概念,如检索与生成的集成以及迭代查询优化,追溯到2000年初的工作。他们认为,社区碎片化和术语变化导致了这种历史连续性被忽视,并建议将LLM视为建立在既有问答架构之上的接口层。这种重构可以通过利用用户建模和答案验证等领域未被充分利用的先前工作,为未来的RAG设计提供信息。
-
LLM校准研究提出新方法以提高基准可比性和域外泛化能力
两篇新研究论文提出了改进大型语言模型(LLM)校准的方法。第一篇论文介绍了一个基于项目反应理论(IRT)的框架,该框架使用锚点项目来校准新基准,即使模型在不同数据集上随时间进行评估,也能实现可比的分数。第二篇论文提出了一种双层优化方法,在训练过程中修改模型参数以最大化预测分布的熵,直接针对过度自信问题并提高域外泛化能力。
-
研究深入探讨具有潜在思维链推理的LLM可监测性
一篇新的研究论文探讨了在使用思维链(CoT)推理时大型语言模型(LLMs)的可监测性,特别关注了通过用连续状态替换显式推理痕迹来降低推理成本的潜在CoT方法。该研究通过在数学推理和问答任务上比较显式CoT与弱监督和强监督潜在CoT,研究了这些潜在CoT方法在监测特定行为(如依赖于输入提示的偏见)方面的有效性。研究结果表明,可监测性更多地受到任务特性和模型内部访问级别的影响,而不是所采用的具体推理模式。
-
新框架诊断用于网络安全问答的小型LLM
开发了一个名为FiT的新诊断框架,用于评估小型大型语言模型(LLM)在网络安全问答(QA)任务中的表现。该框架评估三个关键能力:词汇识别、参数知识和检索信息的语境化。一项使用五个70亿参数模型的实证研究表明,微调可能会对词汇和参数知识产生负面影响,不同的微调机制会导致性能上的权衡。研究结果表明,预微调诊断有助于选择合适的模型,并提高LLM在网络安全领域的安全部署。
-
Embedding 模型:LLM 上下文和检索的核心
Embedding 模型是大型语言模型 (LLM) 的基础,尤其是在检索增强生成 (RAG) 中。这些模型将文本等高维数据转换为低维向量空间,从而促进相似性搜索并捕捉语义关系。这个过程对于 LLM 理解上下文和从数据库中检索相关信息至关重要,增强了文本分类、情感分析和问答等任务。
-
新框架通过可解释的不确定性信号增强问答系统
研究人员开发了一个新的问答(QA)系统框架,该框架利用从大型语言模型(LLMs)派生的可解释不确定性信号。该方法旨在通过区分知识不足与知识模糊或冲突来提高事实准确性和透明度。当知识不足时,系统会触发检索增强生成(RAG);当模糊度高时,则应用额外的推理,为现有策略提供了一种更透明、更实用的替代方案。
-
新研究通过嘈杂数据和选择性预测解决大语言模型对齐问题
研究人员开发了新的方法来改进大语言模型(LLMs)与人类偏好的对齐,即使在处理嘈杂或不完整的数据集时也是如此。一种方法,无偏直接偏好优化(UDPO),在数学上纠正偏好数据中的失真,以实现无偏训练。另一个框架,选择奖励强化学习(RLSR),专注于选择性预测,通过平衡风险和覆盖范围来提高大语言模型的可靠性。此外,一个基于置信区间的校准框架CIC将不确定性分数转换为风险可控的选择性回答规则,为问答系统中的大语言模型响应提供统计保证。
-
新的 TIGRAG 框架通过令牌共现图增强 LLM 的多跳推理能力
研究人员推出了一种新颖的检索增强生成(RAG)框架 TIGRAG,旨在增强大型语言模型的多跳推理能力。与现有方法计算密集且易出错不同,TIGRAG 利用令牌共现知识图谱来有效建模令牌之间的关系。这种方法允许进行可扩展的图构建,并在推理过程中改进互联证据的检索,从而减少索引时间、降低推理延迟并减小提示的占用空间。