PulseAugur
实时 13:30:11
实体 AIFromZero

AIFromZero

PulseAugur coverage of AIFromZero — every cluster mentioning AIFromZero across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_138505 ·

    Prompt Caching Slashes LLM Costs by 90% and Boosts Speed

    Prompt caching 是一种通过重用已计算的提示状态来降低 LLM 应用程序成本和延迟的技术。它涉及将提示分为稳定的前缀(系统提示、工具定义)和易变的后缀(用户查询)。首次调用会因预填充前缀而产生较高成本,但后续具有相同前缀的调用可以加载缓存状态,将这些 token 的成本降低约 90%,并显著减少延迟。此方法需要确定性的前缀,因为任何更改都会使缓存失效,从而导致账单增加而没有明确的错误。

  2. TOOL · CL_114958 ·

    混合专家模型:大模型,低推理成本详解

    混合专家模型(Mixture of Experts, MoE)是一种模型架构,它允许拥有大量参数,同时保持低推理成本。在MoE中,一个路由器网络将每个token导向一个专门的专家网络子集,而不是让它通过整个模型进行处理。这种稀疏激活将模型容量与计算成本解耦,使得能够以更低的成本实现海量模型的质量。然而,挑战包括专家负载均衡、管理所有专家的内存以及潜在的训练不稳定性。

  3. TOOL · CL_106803 ·

    向量数据库通过快速语义搜索赋能RAG

    向量数据库对于检索增强生成(RAG)应用至关重要,它通过将含义转换为向量来实现高效的语义搜索。这些数据库使用近似最近邻(ANN)索引,例如分层可导航小世界(HNSW)图,以快速从数百万个向量中找到最相关的向量,其性能优于传统的关键词搜索。关键组件包括存储向量、原始文本和元数据,流行的选项有 Pinecone、Weaviate 和 Chroma。

  4. TOOL · CL_101220 ·

    向量数据库详解:面向AI工程师的语义搜索与RAG

    本系列文章聚焦于向量数据库,解释其在AI应用中的作用,特别是对于语义搜索和检索增强生成(RAG)。内容涵盖向量数据库如何存储和索引数据为向量,实现超越关键词匹配的快速相似性搜索。文章还涉及嵌入模型的选择,并为AI工程师面试提供基于场景的问题。

  5. COMMENTARY · CL_90155 ·

    LLM Token:文本如何被分解以及它为何对成本和能力很重要

    语言模型通过将文本分解为 token 来处理文本,token 通常是几个字符的片段。这种子词(subword)分词方法被使用,因为使用整个单词会创建一个庞大到无法管理的词汇表,而使用单个字母则需要模型重新学习基本的拼写。token 的数量直接影响 API 成本和上下文窗口限制,使得简洁的提示成为管理费用和效率的重要因素。因此,模型在需要精确字符级分析的任务中会遇到困难,例如计算单词中特定字母的数量,因为它们是基于这些分词的子词单元而不…