Retriever
PulseAugur coverage of Retriever — every cluster mentioning Retriever across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
设备端AI工具路由研究强调神经弃权的需求
研究人员探索了AI助手在设备端的工具路由,区分了工具选择和弃权(当没有工具适用时)。传统的单一语言模型方法在本地设备的延迟和内存方面成本高昂。一种替代方法用检索器取代语言模型,检索器对本地操作进行排序,但无法指示何时没有合适的动作。研究发现,虽然BM25可以有效地为词汇匹配的请求选择工具,但神经组件对于准确的弃权至关重要。使用像multilingual-e5-base这样的冻结编码器仅用于弃权,可以使许多请求保持在本地,同时正确识别需…
-
RAG 详解:LLM 如何访问和使用特定数据来生成答案
检索增强生成(RAG)是 LLM 应用中用于让模型访问其训练集之外的特定、最新数据的一项技术。RAG 流程包括一个检索器从文档中查找相关文本块,然后将这些文本块作为上下文供 LLM 生成答案。生产系统通常包含额外的步骤,如解析、分块、嵌入生成、索引、重排序和构建最终上下文,以提高答案的质量和准确性。
-
OneModel论文提出将业务逻辑内化到AI代理中
研究人员推出了一种名为OneModel的新方法,用于构建AI代理,该方法将复杂的业务工作流直接内化到模型的参数中,摆脱了传统的模块化管道。该方法利用持续预训练(CPT)和逻辑编译SFT,将业务逻辑和标准操作程序整合到统一的注意力空间中。在一个全球金融服务系统中,OneModel展示了显著的改进,将端到端延迟降低了50%以上,并将智能解决率(IRR)从64.3%提高到83.3%。这种方法为脆弱的工程逻辑提供了一种可扩展的替代方案,实现了…
-
为基础设施管理员解释 RAG 框架
本文从基础设施管理者的角度解释了检索增强生成(RAG)。它将 RAG 分解为三个核心组件:检索器(Retriever)、排序器(Ranker)和大型语言模型(LLM),并将其比作分层的服务台系统。文章进一步详细介绍了 RAG 管道,并区分了 RAG 序列(RAG Sequence)和 RAG 令牌(RAG Token)技术,说明它们的功能类似于不同的报告撰写或研究方法。最后,它将 RAG 分为朴素型(Naive)、高级型(Advanc…