OpenTelemetry
PulseAugur coverage of OpenTelemetry — every cluster mentioning OpenTelemetry across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
7 种生产模式用于训练 AI 代理的详细介绍
为生产环境训练 AI 代理涉及一个以基础设施和数据为中心的循环过程。关键步骤包括记录每次代理运行以捕获详细跟踪信息,利用这些跟踪信息从真实流量中构建评估数据集,并对这些跟踪信息进行标注以识别失败。该过程强调提示工程存在局限性,并且使用 LoRA 等技术进行微调至关重要,然后在训练前冻结评估集并重复该循环。大部分工作投入在底层基础设施上,而不是代理的核心逻辑上。
-
在 Kubernetes 上部署的私有 LLM RAG 系统,具有完全可观测性
本文详细介绍了如何使用 Kubernetes 上的 LangGraph 设置私有的检索增强生成(RAG)系统,以增强数据隐私。该设置涉及运行本地 LLM,并利用包括 OpenTelemetry、Prometheus、Grafana、Tempo 和 Loki 在内的可观测性堆栈来监控系统性能、成本并识别瓶颈。该过程涵盖了将数据摄取到带有 pgvector 的 PostgreSQL 数据库中、用于问答的 LangGraph 工作流以及在 …
-
Parseable 可观测性平台与 Datasette 集成
Simon Willison 探讨了将新的可观测性平台 Parseable 与 Datasette 集成。Parseable 提供开源 Rust 实现和云托管选项。Willison 使用 OpenAI 的 Codex 帮助配置 Parseable,以摄取来自 Datasette 的 OpenTelemetry 跟踪,展示了该过程和生成的跟踪可视化。
-
AI Agent 框架成本可见性审计揭示了显著的差距
对五个流行的 AI Agent 框架进行的最新审计显示,在成本可见性和控制方面存在显著差距。虽然 LangGraph(配合 LangSmith)和 Amazon Bedrock AgentCore 等框架提供了强大的代币到美元转换和每个 Agent 的成本跟踪功能,但 CrewAI 和 AutoGen 等其他框架仅提供原始代币使用数据,开发者需要手动计算和归属成本。Strands Agents SDK 提供原生预算上限,但缺乏美元转换…
-
Langfuse、Phoenix、Promptfoo 和 Iris:AI 代理评估工具对比
四款不同的工具——Langfuse、Arize Phoenix、Promptfoo 和 Iris——提供了评估 AI 代理性能的不同方法。Langfuse 和 Arize Phoenix 是已集成评估功能的观测平台,其中 Langfuse 使用 SDK,Arize Phoenix 利用 OpenTelemetry。Promptfoo 作为 LLM 应用的命令行测试运行器,而 Iris 是一个旨在通过确定性规则评估代理跟踪的评估服务器。…
-
LLM软件包安全:注册时机优于存在性检查
一位安全研究员发现,仅依赖LLM生成的名称进行软件包存在性检查是不够的,这会导致误报。通过分析软件包注册时间与LLM首次臆想出名称的时间,该研究员开发了一种更准确的方法。这种新方法正确地将LLM建议名称之前注册的软件包识别为可信的,并将其与可能为响应臆想而注册的软件包区分开来。
-
开发者评估论文阅读AI,绕过传统RAG方法
一位开发者详细介绍了评估其论文阅读AI项目Talkit的过程,该项目可以回答有关研究论文的问题。与典型的检索增强生成(RAG)系统不同,Talkit不使用向量存储,因为整篇论文都适合模型上下文窗口。评估包括针对“Attention”论文创建十个问题,使用DeepEval进行评分,并集成OpenTelemetry跟踪与Confident AI以监控答案质量。初步结果显示完全忠实,但揭示了其他问题,例如模型有时未能提供答案。
-
MIT TypeScript 层优化 OpenTelemetry 日志管理
一个新构建的 MIT TypeScript 层旨在管理 OpenTelemetry 日志。该系统名为 Jev,可以对日志进行评分、排序和路由,通过仅保留必要的信号数据来优化存储成本。
-
Bifrost AI 网关增强模型上下文协议 (MCP) 的可观测性
模型上下文协议 (MCP) 使 AI 代理能够连接到外部系统,但点对点连接会带来重大的可观测性挑战。Bifrost 是由 Maxim AI 开发的开源 AI 网关,它通过充当中高性能中间件来统一 LLM 路由和 MCP 网关功能,从而解决这一问题。它为所有工具调用提供结构化日志记录和跟踪,而 Bifrost Edge 将这种可见性扩展到开发人员的笔记本电脑。为确保全面的审计合规性,工程师必须捕获每次工具调用的特定数据维度,包括执行元数…
-
LiteLLM 添加了用于流量镜像和 OTel 追踪的自定义回调
LiteLLM 推出了一个自定义回调功能,专为流量镜像和 OpenTelemetry (OTel) 追踪而设计。此新功能允许用户将追踪数据发送到 VictoriaTraces,从而增强 LLM 应用的可观测性。该集成旨在提供对 AI 模型性能和行为的更好洞察。
-
AWS Bedrock AgentCore 为 AI 代理添加自动化 CI/CD 评估
AWS 推出了基于其 Amazon Bedrock AgentCore 平台构建的 AI 代理的新自动化评估系统。该系统与 GitHub Actions 集成,创建 CI/CD 质量门,在代码更改后自动测试代理性能。如果代理的评估分数低于设定的阈值,系统将阻止拉取请求,防止回归到生产环境。该解决方案涉及部署代理及其关联的 MCP 服务器,处理基于角色的访问控制,并利用 OpenID Connect 实现 GitHub Actions …
-
AI开发者寻求更好的可观测性工具用于Agent工程
构建AI Agent的开发者正在寻求强大的可观测性工具来监控和调试复杂的交互,包括API调用、工具使用和文件操作。用户认为现有解决方案存在不足,并对Opik等工具因糟糕的用户体验表示失望。理想的工具应是一个支持OpenTelemetry的自托管服务,能够进行详细的会话分析、可视化Agent行为,并支持自定义插桩以识别和修复故障模式。
-
ASP.NET Core LLM 应用需要先追踪的可观测性来控制成本和延迟
ASP.NET Core 中的 LLM 应用的可观测性需要一种先追踪的方法来管理成本、延迟和模型质量。单个配置错误的提示可能导致成本大幅增加和性能问题,因此强大的可观测性契约至关重要。实现精细的指标、完整的 OpenTelemetry 追踪和反馈循环涉及复杂性、成本和运营开销之间的权衡,尤其是在多租户 SaaS 环境中。
-
LLM 可观测性必须跟踪 RAG 证据管道,而不仅仅是模型调用
检索增强生成 (RAG) 系统的可观测性需要超越标准的 LLM 跟踪,以包含完整的证据路径。当前的 LLM 可观测性通常侧重于模型调用,掩盖了检索过程中的失败,例如错误的查询重写、过时的信息或被丢弃的相关段落。全面的跟踪应将原始问题与有效查询、检索到的来源、选定的证据和最终声明联系起来,以准确诊断为什么答案可能错误,即使模型调用本身看起来是成功的。
-
AI代理的痕迹可通过四阶段管道转化为训练数据集
一个四阶段的管道可以将AI代理运行产生的原始遥测数据转化为用于微调模型的宝贵数据集。此过程首先将每次代理交互捕获为痕迹,然后使用OpenTelemetry的GenAI语义约定等约定来标准化这些数据。下一步涉及对这些痕迹进行采样,因为标记每次运行是不切实际的;策略包括随机采样以及选择有错误或满意度评分低的运行。最后,根据从代理代码库派生的预定义规范对这些采样痕迹进行标记,确保微调的一致性和质量。
-
基于 Rust 的 Aura 代理平台自动化生产事件的解决
Aura 是一个新推出的、基于 Rust 的代理平台,旨在帮助站点可靠性工程师(SRE)调查和解决生产事件。它集成了各种可观测性工具和 AI 模型,允许用户定义代理工作流并将其连接到生产系统。Aura 强调安全性和控制性,支持在隔离环境中部署,并要求对敏感操作进行人工审批,同时还为所有决策提供详细的追踪。
-
LLM 可观测性工具跟踪生产 AI 系统的关键指标
LLM 可观测性对于理解生产环境中 AI 应用程序的行为至关重要,因为传统的监控工具对于非确定性的模型输出来说是不够的。关键指标包括 token 消耗、实时成本、首次 token 时间、回退率和工具执行成功率。Bifröst 和 Unmeshed 等工具提供了用于检测 AI 网关和应用程序编排层的解决方案,提供详细的遥测和工作流可见性。这些平台旨在标准化模型交互,从而能够对复杂的 AI 系统进行更好的根本原因分析、成本归属和可靠性管理。
-
Databricks通过追踪和AI助手削减了每年120万美元的AI代理浪费
Databricks已识别并解决了每年估计达120万美元的AI支出浪费的重大来源。通过实施Unity Gateway的追踪功能并利用其Genie One AI助手,工程师能够查明AI代理中的特定工具故障。这些以前隐藏的、导致重复重试和Token消耗的故障,在1小时内被识别并修复,每年估计解决了499,000美元的Token浪费和12,000小时的工程时间。
-
Graham Dumpleton 发布 wrapture,用于 Python 跟踪和测试
Graham Dumpleton 发布了一个新的 Python 库 wrapture,旨在通过包装函数和方法来促进跟踪和测试。该库允许观察代码执行,从而实现跟踪并能够覆盖返回值。Wrapture 与 OpenTelemetry 集成,并提供了一种基于配置的方法,用于为现有的 Python 项目添加跟踪功能。Dumpleton 强调,该库在很大程度上是在 AI 辅助下开发的,强调的是一种有方向的工程过程,而不是无指导的“氛围编码”。
-
AWS Bedrock 通过多知识库支持增强企业代理检索
Amazon Web Services (AWS) 为其 Amazon Bedrock 受管知识库引入了新功能,增强了企业代理检索能力。这些更新允许跨多个知识库进行更复杂的多轮推理和检索,为用户查询提供引文支持的答案。该系统集成了 AWS CloudFormation 进行部署,并包含使用 OpenTelemetry、AWS X-Ray 和 Amazon CloudWatch 等工具进行内置可观测性功能,以监控代理行为和性能。此外,该…