Grafana
PulseAugur coverage of Grafana — every cluster mentioning Grafana across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
在 Kubernetes 上部署的私有 LLM RAG 系统,具有完全可观测性
本文详细介绍了如何使用 Kubernetes 上的 LangGraph 设置私有的检索增强生成(RAG)系统,以增强数据隐私。该设置涉及运行本地 LLM,并利用包括 OpenTelemetry、Prometheus、Grafana、Tempo 和 Loki 在内的可观测性堆栈来监控系统性能、成本并识别瓶颈。该过程涵盖了将数据摄取到带有 pgvector 的 PostgreSQL 数据库中、用于问答的 LangGraph 工作流以及在 …
-
编码代理集成监控服务器以提供SRE洞察
作者提出了一个系统,其中一个编码代理与监控服务器(MCP)集成,可以提供站点可靠性工程(SRE)的洞察。该系统将利用检索增强生成(RAG)来总结日志,并识别跨越Django、Docker和Nginx等各种项目和技术的关键错误。通过为编码代理提供代码上下文,它不仅可以诊断问题,还可以提出解决方案,从而创建一个更受控和自愈的系统。
-
AI代理:控制工具访问以降低成本和提高安全性
本文讨论了一种管理AI代理工具访问的方法,重点在于控制令牌成本和权限。作者提出了一个三管齐下的方法:一个默认拒绝的沙箱环境,一个指定仅需要工具的任务特定工具允许列表,以及一个详细记录所有操作以供审计的日志。目标是防止代理产生过高的令牌成本,并将它们的能力限制在特定任务所需范围内,从而提高安全性和成本效益。
-
AI 的 GPU 工作负载监控需要多工具技术栈
AI 的 GPU 工作负载监控需要一个全面的工具技术栈,而非单一解决方案。对于通过 SSH 进行的即时诊断,推荐使用 nvtop。然而,对于生产环境的 AI,则需要结合使用 DCGM Exporter、Prometheus 和 Grafana 来历史性地追踪 VRAM 崩溃和热节流等问题,这对于扩展裸金属 GPU 服务器至关重要。
-
廉价的AI代码审查器在安全错误方面表现不佳,高级模型表现出色
对Luna和Astra两个AI模型进行代码审查的比较,揭示了它们在有效性方面的显著差异,尤其是在安全漏洞方面。虽然较便宜的模型Luna在常规错误方面表现相当,但在安全相关问题和授权逻辑方面却遇到了困难。Astra是一个更高级的模型,识别出更多的安全错误,并且具有更高的精确率,这表明每token的成本并不是代码审查工具价值的唯一决定因素,尤其是在关键代码段方面。
-
GPT-5.6 Luna 提供的代码审查价值是 GPT-6 Astra 的 75%,成本仅为其 3.6%
对 GPT-5.6 Luna 和 GPT-6 Astra 进行代码审查的比较发现,成本显著更低的 GPT-5.6 Luna 模型在每次审查的成本上,识别出了 GPT-6 Astra 所发现的已验证错误的 75%。虽然 GPT-5.6 Luna 更快且更具成本效益,但其误报率更高,并且在处理安全相关错误时遇到困难,尤其是在身份验证和权限逻辑等复杂系统中。分析表明,GPT-5.6 Luna 适用于一般的正确性检查,但不适用于关键的安全代码。
-
Langfuse 填补 AI 代理的可观测性空白
当前的 Grafana 和 Datadog 等可观测性工具已不足以满足 AI 代理日益增长的需求。Langfuse 旨在通过提供专门的 AI 开发可观测性解决方案来填补这一空白。
-
新工具 MCP RTK 将 AI 令牌使用量削减 90%
一款名为 MCP RTK 的新开源工具已被开发出来,旨在在使用 Claude Code 等 AI 模型与外部工具时显著减少令牌消耗。该工具充当代理,在服务器响应到达 AI 之前过滤掉不必要的数据,从而节省数百万个令牌并降低成本。MCP RTK 采用 8 步过滤流程,包括删除空字段、截断长字符串和剥离技术元数据,并为 GitLab 和 Grafana 等流行服务提供可配置的预设。
-
AI 使用 Google Cloud 和 Grafana 编排电影摄制组
本文详细介绍了 Thirai Kuzhu AI 的工程架构,这是一个旨在实时编排电影摄制组的自主系统。该系统使用 Google Cloud ADK 和 Grafana 构建,解决了从午夜流媒体崩溃到实时 AI 电影摄制组协调的各种挑战。该项目旨在创建一个拥有 369 个角色的电影操作系统。
-
新云因安全漏洞受到批评,OpenAI 和 Hugging Face 受到比较
SemiAnalysis 的一份报告强调了大多数新云产品存在严重的安全漏洞,特别是关于容器逃逸和内核绕过。分析对比了 OpenAI 和 Hugging Face 的安全方法,还涉及网络策略、安全密钥和多租户 Grafana 实例。在这些安全问题的背景下,还提到了 ClusterMAX 3.0 的预览版。
-
AI初创公司可通过优化模型路由来削减成本
初创公司可以通过实施动态请求路由策略来优化AI模型的使用,平衡成本和性能。这包括分析低成本模型和前沿模型的历史数据,以建立智能升级阈值,例如200毫秒的响应时间限制。Prometheus和Grafana等实时监控工具对于动态调整这些阈值至关重要,可能带来AI运营费用30-50%的显著成本节约,并提高用户满意度。
-
Grafana MCP 将 AI 代理与可观察性数据集成
Grafana MCP 是一项新集成,允许 Claude 和 Cursor 等 AI 代理使用自然语言直接查询 Grafana 实例。此工具使 AI 代理能够访问仪表板、指标、警报和日志,从而简化故障排除和监控流程。用户可以提出诸如“API 延迟现在怎么样?”之类的问题,AI 将提取相关数据,将其与部署注释相关联,并分析日志以确定根本原因。
-
Grafana 在人工智能生产需求推动下,年经常性收入突破 6 亿美元
Grafana 的年经常性收入已超过 6 亿美元,这得益于对支持公司将人工智能集成到生产环境中的工具的需求增加。首席执行官 Raj Dutt 强调了这一增长,并将其归因于采用人工智能技术的企业不断变化的需求。
-
Deepgram通过新指标增强SageMaker AI可观测性
Deepgram已增强其在Amazon SageMaker上部署的自托管语音模型的AI可观测性。新的功能,Deepgram增强指标以及对Prometheus和OpenTelemetry的支持,提供了对使用情况、计费和引擎行为的更大透明度。这些创新允许用户将AWS账单与实际流量进行核对,并直接在AWS账户中查询详细的引擎级指标,从而解决了自托管AI部署中的历史权衡问题。
-
使用Prometheus和Grafana调试LLM API
本文详细介绍了一种使用Prometheus和Grafana为大型语言模型(LLM)API实现可观测性的实用方法。作者概述了如何利用指标、日志和异常检测来有效调试和监控API的性能。该过程包括借助LLM生成事件摘要。
-
2026 年 MLOps 生态系统:关键工具和集成
到 2026 年,MLOps 生态系统预计将发生重大演变,重点是集成工具链。Kubernetes 和 Docker 等关键技术将继续作为容器化和编排的基础。Terraform 和 Ansible 等工具对于基础设施即代码至关重要,而 Prometheus 和 Grafana 将提供必要的监控功能。工作流管理可能由 Apache Airflow 和 Kubeflow 等平台主导,mlflow、Data Version Control、W…
-
Grafana Agent 可观测性项目用于 Hermes Agent 在 GitHub 上发布
一位开发者创建了一个名为 Grafana Agent 可观测性用于 Hermes Agent 的开源项目。该项目旨在为 Hermes Agent 系统提供监控和可见性。代码可在 GitHub 上获取,允许社区贡献和审查。
-
开发者在最小硬件上构建高性能搜索微服务
一位开发者详细介绍了如何创建一个高性能搜索微服务,该服务旨在处理包含一百万件商品和每日超过1500万次请求的产品目录。该服务使用OpenSearch、Redis和PostgreSQL等组件构建,在最小硬件(2个CPU核心、12 GB RAM)上实现了大约每秒180次搜索。作者强调,虽然AI可以快速生成代码,但关键的工程挑战在于构建一个健壮的系统和做出承载负载的决策,而这是AI目前无法复制的。
-
通过选择更好的信号修复 vLLM 自动扩缩容抖动问题
本文解决了 vLLM 自动扩缩容中出现的“抖动”问题,即 Pod 在运行和失败状态之间快速循环,导致成本和延迟增加。作者解释说,这个问题通常源于选择了不合适的自动扩缩容信号,而不是配置不正确。文章详细介绍了通过三个步骤来改进自动扩缩容,即从任意阈值转移到计算阈值,最终实现一个稳定的设计,该设计使用更健壮的信号来防止振荡。
-
面向DevOps的生成式AI课程涵盖GPU基础设施和LLM服务
一系列帖子详细介绍了“面向DevOps的100天生成式AI”课程,重点关注运行大型语言模型的基础设施和运营方面。该课程涵盖了诸如Kubernetes中的GPU利用率、vLLM等高效LLM服务框架以及LLM的GPU内存需求计算等主题。它旨在为DevOps、SRE和平台工程师提供将AI集成到其工具包中的技能,超越基础的提示工程,转向构建和管理由AI驱动的解决方案。