PulseAugur
中
实时 19:15:24
实体 chromadb

chromadb

PulseAugur coverage of chromadb — every cluster mentioning chromadb across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
56
90 天内 56
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-19 research_milestone A critical remote code execution vulnerability was disclosed for ChromaDB. 来源
  2. 2026-05-19 controversy A critical remote code execution vulnerability was disclosed in ChromaDB. 来源
  3. 2026-05-19 controversy A critical, unpatched remote code execution vulnerability was disclosed in ChromaDB. 来源
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/4 页 · 共 65 条
  1. TOOL · CL_283370 ·

    Python脚本将PDF转换为可搜索的向量数据库

    一位开发者创建了一个Python脚本,可以将一系列PDF文档转换为可搜索的向量数据库。该工具利用了pypdf和ChromaDB等库,以及OpenAI的嵌入模型,为那些希望更有效地搜索大量文本数据的工程师提供了高级查询功能。

  2. TOOL · CL_281493 ·

    大型语言模型NPC通过多层系统获得持久记忆

    本文详细介绍了为大型语言模型(LLM)驱动的游戏中的非玩家角色(NPC)实现长期记忆的多层方法。文章概述了四个关键模块:上下文构建器、LLM接口、响应解析器和记忆管理器。记忆管理器通过将相关的历史数据馈送给LLM的提示来维持对话的连续性,这一点至关重要。提出的记忆系统包括用于近期交互的对话缓冲区、使用ChromaDB或Pinecone等数据库跨会话进行检索以实现主题回忆的向量检索,以及用于玩家姓名或承诺等基本信息的结构化事实。作者强调…

  3. TOOL · CL_279459 ·

    开发者构建AI系统以加快客户支持答案的查找速度

    一位开发者创建了一个客户支持AI系统,旨在帮助用户在海量文档中快速找到答案。该系统利用检索增强生成(RAG)原理,处理上传的PDF和文本文件等文档,以提取、分块和嵌入信息。这些嵌入信息存储在ChromaDB中,支持语义搜索,返回相关的文本片段及其原始来源元数据。该项目包括一个用于用户交互的Streamlit界面和一个带有Swagger文档的FastAPI后端,用于API访问。

  4. TOOL · CL_278876 ·

    使用 CLIP 和 ChromaDB 构建艺术品推荐系统

    本文详细介绍了从头开始构建艺术品推荐系统的三部分系列的第一部分。作者旨在指导读者完成整个过程,从数据收集开始。文章强调了博物馆艺术品数据的可用性,并讨论了通过 API 访问数据的挑战,指出一些博物馆现在限制访问。阿姆斯特丹的 Rijksmuseum 被列为一个可行的开放数据源,作者介绍了一个旨在与博物馆 API 交互以检索数据的 Python 类。

  5. TOOL · CL_277639 ·

    Chroma:用于原型设计的轻量级向量数据库,而非生产环境

    Chroma 是一款开源嵌入式数据库,被介绍为一种轻量级、易于使用的解决方案,非常适合原型设计和个人项目。它通过 Python 和 Rust 提供快速设置、本地嵌入模型,并与 LangChain 和 LlamaIndex 等流行框架集成。然而,Chroma 设计用于单节点使用,由于其在可扩展性、数据持久性和安全功能方面的限制,不建议用于具有大型数据集或严格持久性要求的生产环境。

  6. TOOL · CL_258563 ·

    Cursor IDE 开发者构建了基于 Neo4j 的开源内存层

    一位开发者创建了一个名为 Friday 的开源、自托管工具,用于管理 Cursor IDE 中的上下文丢失。Friday 没有依赖消耗宝贵的提示令牌且很快过时的 `.cursorrules` 或 `AGENTS.md` 文件,而是使用了一个模型上下文协议 (MCP) 服务器。该服务器通过有针对性的向量检索按需检索相关的项目内存,并将架构决策和组件事实存储在 Neo4j 中作为关系知识图谱。该系统旨在将提示令牌使用量减少约 90%,并保…

  7. TOOL · CL_254146 ·

    新框架统一太阳能分析、问答和预测

    一篇新研究论文介绍了一种名为“太阳能智能”(Solar Intelligence)的混合框架,旨在统一太阳能分析、科学问答和机器学习预测。该系统整合了来自 NASA POWER、Biosphere 2 和研究论文语料库的数据。它使用 DuckDB 进行结构化查询,融合 BM25 和 ChromaDB 以从语言模型中获取基于证据的答案,并使用 XGBoost 模型进行每日预测。该框架可通过多个接口访问,服务于学生、研究人员和能源分析师。

  8. RESEARCH · CL_253141 ·

    RAG 评估突显合成与真实查询的差距

    研究人员正在探索评估检索增强生成(RAG)系统的细微差别,突显了合成查询和真实查询分布之间存在显著差异。一项关于大学教职员工信息系统的研究发现,与更长、分布更均匀的合成查询相比,真实用户提出的问题更短、更集中,涉及的主题也更少。这种差异可能导致 RAG 配置在合成基准测试上表现良好,但在现实场景中表现不佳,并可能增加延迟。与此同时,开发人员正在构建实用的 RAG 流水线,详细介绍了嵌入生成、使用 Qdrant 或 ChromaDB 等…

  9. COMMENTARY · CL_221465 ·

    RAG 分块策略在实际测试中存在缺陷

    一篇技术博文测试了四种常见的检索增强生成(RAG)分块策略,发现其中两种在应用于实际文档时存在严重缺陷。作者发现元数据标题被包含在分块中,并且一种策略生成了一个包含整个文档的过大分块。这些问题凸显了数据清理的重要性以及仅依赖基准数据集进行 RAG 实现的局限性。

  10. TOOL · CL_220907 ·

    开源人工智能执行团队启动,为企业提供咨询服务

    开发人员创建了一个名为 Open Executive 的开源人工智能执行团队,旨在充当企业的虚拟高级顾问。该系统利用八个专业的人工智能代理,包括首席战略官和首席财务官等角色,根据内置知识和用户上传的公司文件提供综合性回复。Open Executive 还具有情景记忆功能,可以回忆过去的决策,并具有用于主动任务管理的调度程序。

  11. TOOL · CL_216717 ·

    在您自己的文档上构建本地 RAG 聊天机器人

    本指南详细介绍了如何使用 Python、Ollama 和 ChromaDB 构建本地检索增强生成(RAG)聊天机器人。该项目允许用户查询自己的文档,而无需 API 密钥或云服务,完全在内存仅为 8GB 的笔记本电脑上运行。关键步骤包括设置必要的软件、加载和分块文档、使用 `nomic-embed-text` 将这些块嵌入向量、将它们存储在 ChromaDB 中,然后使用 `llama3.2` 查询系统,同时提供相关上下文以最大限度地减少幻觉。

  12. TOOL · CL_211176 ·

    模型上下文协议 (MCP) 的无状态更新破坏了本地 Python 工具

    模型上下文协议 (MCP) 最近经历了一次重大的架构性改革,过渡到一种无状态的 HTTP 请求/响应模型。这一变化虽然有利于 Cloudflare Workers 和 AWS Lambda 等大规模分布式代理基础设施,但却破坏了依赖于先前有状态传输和持久会话的现有本地 Python 工具。维护自定义 MCP 服务器的开发人员必须仔细管理依赖项,以避免在不知情的情况下升级到新的、不兼容的版本。

  13. TOOL · CL_206770 ·

    混合 RRF 检索修复了卡纳达语文学作品上的 RAG 故障

    一位开发者详细介绍了为扫描的卡纳达语小说构建检索增强生成(RAG)系统所面临的挑战,并强调检索而非语言模型是主要瓶颈。由于卡纳达语的黏着语性质以及文学文本的稀缺性,最初在 ChromaDB 中使用标准多语言嵌入的方法失败了,导致了不准确和幻觉般的响应。解决方案涉及一种结合了 BM25 和密集嵌入以及倒数排名融合(Reciprocal Rank Fusion)的混合检索系统,以及用于精确页面查询的正则表达式路由器,显著提高了忠实度和上下文召回率。

  14. TOOL · CL_178986 ·

    Langchain-Rust 框架支持纯 Rust 构建 LLM 应用,绕过 Python

    langchain-rust 库提供了一个全面的框架,用于完全用 Rust 构建 LLM 应用,无需 Python。它为 Ollama 的本地模型提供了头等集成,支持工具调用、视觉和流式传输等功能。该框架还支持九种不同的向量存储后端、BM25 关键字搜索、具有 RRF 融合的混合检索以及 GraphRAG 和 CorrectiveRAG 等高级 RAG 技术。此外,它还具有本地代码解释器和本地嵌入,以及 LangGraph 工作流和各…

  15. TOOL · CL_178730 ·

    Google 的 OKF 格式与经典 RAG 进行基准测试

    最近一项基准测试将传统的向量检索增强生成(RAG)与 Google 的新开放知识格式(OKF)进行了比较,结果显示这两种方法都不是完美的。虽然 OKF 与 RAG 结合比单独使用经典 RAG 有所改进,但在处理某些类型的查询时仍然存在困难,特别是那些需要从大量非结构化文档中检索信息的查询。基准测试突出了分块、上下文组成以及模型识别当前信息与已弃用信息的能力方面存在的问题。

  16. TOOL · CL_166286 ·

    使用 RAG 和 MCP 构建本地 AI 问答系统

    本指南详细介绍了如何构建一个本地问答系统,该系统能够查询 PDF 和电子表格等个人文档。它利用检索增强生成 (RAG) 结合模型上下文协议 (MCP) 来创建一个模块化管道。该系统将由三个服务组成:文档摄取服务器、MCP 工具服务器以及由 LangChain 提供支持的对话式 AI 代理。

  17. TOOL · CL_166838 ·

    新型水下监测系统利用本地人工智能节省能源

    研究人员开发了一种新颖的、节能的水下监测系统,该系统将连续低功耗传感与按需本地推理相结合。该架构使用 MAX78000/MAX78002 微控制器进行持续信号监测,仅在需要处理或交互时才激活更强大的 NVIDIA Jetson Orin NX。该系统采用多模态管道进行数据摄取、目标提取和物种识别,并利用存储在 ChromaDB 中的 BioCLIP/OpenCLIP 嵌入。一个基于 LangChain 的多代理框架负责查询路由、能源和…

  18. TOOL · CL_165259 ·

    AI平台将医疗报告转化为清晰的患者信息和公共卫生洞察

    一个开发团队创建了社区健康情报助手(Community Health Intelligence Assistant),这是一个人工智能驱动的平台,旨在提高个人健康素养并实现预测性公共卫生监测。该平台处理医疗实验室报告,为患者提供清晰易懂的答案,并匿名贡献数据用于公共卫生分析。最新版本v2.0具有现代化的用户体验,支持实时流式传输,通过可验证的来源证据增强AI信任度,并升级了使用Google Gemini 2.5的引擎。

  19. TOOL · CL_164317 ·

    US Neural 开发本地语义注册表以取代LangChain的工具路由

    US Neural的一名开发人员开发了一个名为Mycelium的本地语义注册表,以解决LangChain工具路由中存在的效率低下问题。新系统旨在提供更快、更确定的工具发现,其冷启动发现延迟为9.6毫秒,而据报道LangChain的AgentExecutor需要194毫秒。Mycelium利用本地嵌入和ChromaDB作为其基础设施,在拥有10万个代理的合成语料库的测试中,实现了70.7%的意图匹配准确率。

  20. TOOL · CL_163318 ·

    开发者训练自定义的640万参数Transformer模型用于食谱应用

    一位开发者详细介绍了他们如何从头开始为名为Rasaveda的食谱应用程序构建一个自定义的640万参数Transformer模型。开发者没有依赖OpenAI或Hugging Face等外部API,而是使用PyTorch在单个Colab T4 GPU上训练了该模型。这种方法实现了一个独立的、无依赖的推理路径,避免了API密钥、速率限制和按token计费的问题。该模型分两个阶段进行训练:首先在WikiText-2上进行通用语言理解训练,然后…