PulseAugur
实时 18:33:15
English(EN) Reduce RAG costs on Amazon Bedrock with query-aware compression

AWS Bedrock 通过查询感知压缩降低 RAG 成本

AWS 推出了一种新方法,以降低 Amazon Bedrock 上检索增强生成 (RAG) 的相关成本。这种称为查询感知压缩的方法,涉及使用一个更小、成本更低的模型来过滤检索到的文本块,然后再将它们发送给主模型。通过减少主模型处理的输入 token 数量,该技术旨在降低运营费用,同时保持甚至提高答案质量并减少幻觉。该实现利用 AWS Lambda,并可与现有的 Amazon Bedrock 功能集成以进一步优化。 AI

影响 降低了 Amazon Bedrock 上 RAG 应用的运营成本,可能促进更广泛的应用。

排序理由 这是优化现有服务的技术实现细节,并非新的模型发布或重大的行业转变。

在 AWS Machine Learning Blog 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AWS Bedrock 通过查询感知压缩降低 RAG 成本

报道来源 [1]

  1. AWS Machine Learning Blog TIER_1 English(EN) · Aakanksha Veesam ·

    使用查询感知压缩降低 Amazon Bedrock 上的 RAG 成本

    Input tokens are often a meaningful part of the cost of running Retrieval Augmented Generation (RAG) at scale. This post describes a query-aware context compression pattern on Amazon Bedrock: after retrieval, a smaller model filters retrieved chunks against the query before the p…