Royal Galician Academy
PulseAugur coverage of Royal Galician Academy — every cluster mentioning Royal Galician Academy across labs, papers, and developer communities, ranked by signal.
-
博主分享长篇 MDX 文章的 LLM 分块策略
一位技术博主详细介绍了在将长篇 MDX 文章输入大型语言模型 (LLM) 时管理 Token 限制的策略。作者解释说,超出模型的上下文窗口会导致错误或处理不完整,这对于检索增强生成 (RAG) 系统尤其成问题。为解决此问题,该博文概述了有效的内容分块方法,这些方法可以保留语义完整性,优先考虑像 Markdown 标题 (H2, H3) 这样的结构元素,而不是简单的字符计数,以确保每个片段内的有意义的上下文。
-
GraphRAG通过检索连接知识来减少LLM令牌使用量
使用TigerGraph的GraphRAG方法开发的两个项目展示了其在减少令牌使用量和提高大型语言模型答案质量方面的有效性。这两个系统一个专注于网络安全,另一个专注于生物医学,将GraphRAG与传统的纯LLM和基础RAG方法进行了比较。通过利用知识图谱检索连接的实体和关系,GraphRAG为LLM提供了更集中的上下文,从而在保持准确性的同时降低了成本和延迟。
-
CyberGraph RAG 使用 TigerGraph 改进 LLM 网络安全分析
研究人员开发了 CyberGraph RAG,一个旨在通过利用图数据库来改进大型语言模型处理网络安全数据方式的系统。与难以处理网络安全威胁关系性的传统 RAG 不同,CyberGraph 将威胁行为者和漏洞等实体建模为 TigerGraph 中的一个图。这种方法可以更集中地检索相关关系,与仅使用 LLM 或基本向量 RAG 的方法相比,可减少 token 使用量、降低延迟并提高响应的事实一致性。
-
Agentic RAG 修复了 LLM 管道中 40% 的检索失败
一种名为 Agentic RAG 的新方法解决了标准 RAG 管道中显著的检索失败问题,该问题在生产环境中高达 40% 的时间会失败。与标准 RAG 不同,Agentic RAG 使用代理动态管理检索过程,分解复杂查询,迭代检索信息,并包含一个自我批评循环以确保答案的置信度。此方法对于准确性和来源归属至关重要的复杂查询、高风险应用程序和大型知识库特别有用。
-
LLM Wiki 在摄取时合成知识,优于 RAG
LLM Wiki 是一种新颖的知识管理方法,它在摄取时合成信息,而不是像传统的 RAG 系统那样按需检索片段。这种方法旨在主动构建结构化知识,并阐述何时这种预合成策略比查询时检索更有效。
-
GraphRAG 基准测试显示其比 RAG 和仅 LLM 的效率更高
在 TigerGraph 黑客松期间,两位开发者构建了基准测试平台,以比较大型语言模型(LLM)的推理管道。他们的工作旨在展示结合了基于图的检索的方法 GraphRAG,如何优于传统的仅 LLM 和基础 RAG 方法。通过使用人工智能研究论文和医学信息的数据集,他们评估了 token 使用量、延迟、成本和响应质量,以显示 GraphRAG 的效率和准确性优势。
-
LLM 微调详解:SFT、RAG 和数据准备
这篇博文解释了微调大型语言模型(LLM)以适应特定任务的过程和必要性。它将微调与检索增强生成(RAG)区分开来,指出微调最适合改变模型行为或推理,而 RAG 则用于整合外部或频繁变化的知识。文章详细介绍了监督微调(SFT),它使用指令-答案对来训练模型,并提供了 SFT 的数据准备示例,包括使用其他 LLM 生成合成数据集。
-
Spartans-GraphRAG 利用知识图谱降低 LLM 令牌成本
一个名为 Spartans-GraphRAG 的新系统已被开发出来,以提高大型语言模型 (LLM) 推理的效率,特别是在网络安全威胁情报等复杂任务中。与传统的检索增强生成 (RAG) 方法相比,该系统利用知识图谱来减少令牌消耗。通过将关系表示为紧凑的三元组而不是冗长的句子,Spartans-GraphRAG 在保持或提高分析准确性的同时,显著减小了提示的大小和相关成本。
-
RAG 管道故障源于嵌入归一化漂移
生产环境中的 RAG 系统常常因嵌入归一化漂移而无法为用户查询返回结果,这是教程环境中通常不会遇到的问题。当用户查询应用的预处理方式与摄入文档语料库时使用的预处理方式不一致时,就会发生这种情况。因此,查询和文档嵌入之间的余弦相似度急剧下降,导致检索不到文档,无法回答用户的问题。
-
生成式AI通过基于代币的交易重新定义软件经济
随着生成式AI的出现,软件开发的经济模式发生了根本性转变,将每个提示都变成了金融交易。与成本可预测的传统软件不同,LLM的交互会消耗代币,使得每个架构决策都成为成本管理问题。这种新范式要求关注AI FinOps,其中高效的代币使用和智能的模型路由对于可持续扩展至关重要。那些掌握经济上可行架构的组织,而不仅仅是拥有最智能模型的组织,将处于领先地位。
-
原始HTML阻碍LLM性能,Markdown更受青睐
原始HTML通常包含过多的样板代码和结构噪音,这会阻碍大型语言模型(LLM)和AI代理。直接将原始HTML输入LLM会导致令牌浪费、内容重要性被误解,以及在RAG系统中的检索性能下降。作者提倡将HTML转换为更干净的格式,如Markdown,后者能更好地保留关键内容,同时丢弃无关的布局和导航元素,最终提高LLM的输出质量和代理行为。
-
开发者使用 SHA-256 优化离线 RAG 知识库更新
一位开发者创建了 GridMind,一个专为低资源环境设计的离线 RAG 助手,以应对高效更新知识库的挑战。该解决方案使用 SHA-256 哈希来为文档打指纹,使系统能够识别并重新嵌入仅更改或新增的文件。此方法显著减少了处理时间,将嵌入时间从几分钟缩短到几秒钟,从而在开发过程中实现更快的迭代。
-
RAG 管道通过多阶段重排模型获得精度
在检索增强生成 (RAG) 管道中实现重排层对于提高答案精度至关重要,因为初始检索阶段可能会找出相关文档,但会将最佳答案埋没在不太理想的文档中。生产就绪的重排器涉及多个组件,包括更广泛的初始检索集、像 BAAI 的 BGE-reranker-v2-m3 这样的主要本地交叉编码器模型,以及像 Cohere 这样的后备托管 API。诸如倒数排名融合之类的策略可以组合来自不同来源的分数,而延迟和成本预算,以及优雅降级和评估工具,对于稳健部署至关重要。
-
Qwen 2.5 驱动多轮检索系统荣登 SemEval 排行榜
研究人员开发了一个用于多轮对话的三阶段检索系统,提高了信息检索任务的准确性。该系统首先使用微调的 Qwen 2.5 7B 模型优化上下文相关的查询,生成独立的问句。然后,它采用结合了 BM25 和密集向量检索的混合搜索,并与倒数排名融合(Reciprocal Rank Fusion)相结合,最后由一个交叉编码器模型对结果进行重新排序以提高精度。这种方法在最近的 SemEval 任务中取得了显著的 nDCG@5 分数,优于许多其他系统。
-
RAG 代理使用自查询、纠正性和自适应检索
本文探讨了增强大型语言模型检索和利用信息的高级检索增强生成 (RAG) 技术。它详细介绍了三种模式:自查询 RAG,它优化向量数据库的搜索查询;纠正性 RAG (CRAG),它验证检索到的文档的相关性并在相关性较低时采取行动;以及自适应检索,它根据问题的类型动态选择检索策略。这些方法旨在通过解决常见的 RAG 限制来提高 LLM 响应的准确性和可靠性。
-
AI工程师角色围绕LLM堆栈、Python和RAG固化
对3449份AI工程师职位发布的2026年分析显示,该角色已围绕LLM堆栈固化,需要Python、LLM、检索增强生成(RAG)和云平台技能。虽然Python和LLM被认为是必备技能,但RAG和LangChain等框架现已普及。AI工程师的美国基本薪资中位数为146,000美元,分布式系统和数据平台技能可带来显著溢价。
-
AI 智能体打破 RAG;GraphRAG 等新架构应运而生
检索增强生成(RAG)是一种流行的聊天机器人 AI 架构,但随着 AI 智能体的日益复杂,它正面临局限性。领先的向量数据库提供商 Pinecone 已承认一项设计缺陷:智能体将 85% 的计算资源用于检索而非推理,导致任务完成率低下。这种低效源于智能体需要为多步任务反复重新发现上下文,这与简单的聊天机器人不同。GraphRAG 等新架构正在通过将数据构建为知识图谱来解决这些问题,从而实现更高效的智能体上下文遍历。
-
本地LLM用户发现较低的量化能以最小的质量损失来降低延迟
通过理解量化对延迟和质量的影响,可以优化本地运行大型语言模型。虽然Q4_K_M是常见的默认设置,但像Q3_K_S这样的较低量化级别可以显著降低编码问题等任务的延迟,并且感知的质量损失很小。最佳量化级别取决于具体的用例和上下文窗口大小,需要用户分析他们的工作流程以找到速度、内存使用和输出质量之间的最佳平衡。
-
RAG 系统在生产环境中失败是由于工程缺陷,而非设计缺陷
本文认为,检索增强生成(RAG)系统本身并无固有缺陷,其在生产环境中的失败源于糟糕的工程实践。文章以一个银行聊天机器人失败的真实案例为例,指出了诸如分块大小过小、嵌入模型不匹配以及重排不足等问题。文章提供了一个优化 RAG 管道的指南,涵盖了从分块到评估的各个层面,旨在提高生产环境中的性能、降低成本并增强可信度。
-
新框架指导大语言模型在检索增强生成(RAG)和长上下文处理之间进行选择
研究人员开发了一个名为 Pre-Route 的新框架,以帮助大语言模型(LLM)决定在文档理解中使用检索增强生成(RAG)还是长上下文(LC)处理。这个主动系统使用轻量级元数据来分析任务、估算覆盖范围并预测信息需求,从而做出更具可解释性和成本效益的路由决策。实验表明,Pre-Route 在 LaRA 和 LongBench-v2 等基准测试中优于现有方法,证明大语言模型具有潜在的路由能力,可以被有效激发,甚至可以蒸馏到更小的模型中。