Apache Solr
PulseAugur coverage of Apache Solr — every cluster mentioning Apache Solr across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
LLM用于分析文献中按性别划分的血压变异
研究人员探索了使用大型语言模型(LLM)分析科学文献中不同生物性别间的血压变异。该研究利用自然语言处理(NLP)技术和一个基于Apache Solr的搜索引擎从PubMed检索相关文章。进行了使用少样本学习和零样本LLM(如Llama 3和GPT-3.5)的实验,以提取血压值的均值和标准差,以及相关的生物性别指标。
-
使用 Spring AI、Nutch 和 Solr 构建文档服务器
本指南详细介绍了创建自定义 MCP 服务器以提供文档的过程。它概述了一个涉及使用 Apache Nutch 爬取文档、Apache Solr 索引爬取的内容以及 Spring AI 与 Claude 等语言模型集成的过程。目标是构建一个能够有效检索和呈现文档信息的系统。
-
新的连接索引技术显著加快搜索引擎查询速度
研究人员开发了一种在搜索引擎中执行连接的新方法,特别是在 Apache Solr 上使用 Lucene 段。该技术改编自关系数据库系统,创建了一个连接索引,通过避免查询时键转换并启用并行、剪枝的半连接来显著提高性能。基准测试显示,与现有的 Solr 连接实现相比,平均查询延迟降低了 5.4 倍,并且在更高的负载和并发下性能增益会增加。
-
将 RAG 扩展到 1000 万份文档需要先进的摄取和检索技术
将检索增强生成(RAG)系统从几千份文档扩展到数百万份会带来重大挑战,这些挑战常常会破坏简单的实现。生产规模的 RAG 需要强大的摄取管道,能够使用 Apache Tika、Unstructured 和 Docling 等工具处理各种文件格式,以提取文本和结构元数据。有效的分块策略至关重要,优先考虑语义完整性和保留文档结构,而不是固定大小的分割,LlamaIndex 等工具提供了高级方法。在规模化方面,向量搜索依赖于 HNSW 等近似…
-
Eugene Yan 解释如何引导搜索相关性标签
Eugene Yan 的博文回答了一位读者关于如何在不依赖昂贵的人工标注者的情况下为语义搜索系统引导标签的问题。Yan 建议从传统的词汇搜索方法(如 BM25)开始,然后利用用户点击数据作为隐式标签来训练语义搜索模型。这种方法旨在使构建具有自定义数据的搜索引擎的过程在经济上更可行。