Arize Phoenix
PulseAugur coverage of Arize Phoenix — every cluster mentioning Arize Phoenix across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
软件更新包括内存优化和服务器升级
此次更新详细介绍了多个项目的多项软件增强和错误修复。值得注意的是,索引键内存使用量已减半,MCP 服务器已升级到 FastMCP。此外,还发布了新版本的 fluxer-app-proxy-self-hosted。
-
LLM可观测性工具捕获数据但未能判断代理输出质量
文章讨论了LLM基础设施的演变,从直接的供应商SDK转向LLM网关和专用可观测性堆栈。虽然LiteLLM和Portkey等网关简化了模型切换,但Langfuse和LangSmith等可观测性工具捕获了详细的跟踪数据。然而,作者认为,当前的可观测性解决方案侧重于观察代理行为,而不是评估其输出的质量或正确性,这在理解代理性能方面留下了关键的空白。
-
ClickHouse 以 4 亿美元收购 LLM 可观测性平台 Langfuse
ClickHouse 在其 4 亿美元的 D 轮融资中收购了开源 LLM 可观测性平台 Langfuse,此轮融资使 ClickHouse 的估值达到 150 亿美元。此次收购凸显了 LLM 可观测性市场日益增长的重要性,该市场预计到 2030 年将达到 92.6 亿美元。值得注意的是,Langfuse 及其竞争对手 Helicone 都使用 ClickHouse 进行分析,这表明 LLM 跟踪数据正朝着专用存储引擎发展。
-
LLM评估工具提供指标,但关键挑战依然存在
对五个流行的LLM评估工具——Arize Phoenix、DeepEval、Future AGI、Langfuse和Ragas——的回顾表明,虽然它们提供了广泛的预构建指标,但这些指标仅占评估过程的20%的简单部分。这些工具在很大程度上仍未解决的关键挑战是选择与特定故障模式准确对齐的指标以及为结果建立误差范围。作者认为,LLM评估的真正成功取决于理解系统的独特故障分类法并据此选择或创建自定义指标,而不是仅仅依赖提供的商品化指标目录。
-
随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化
LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…
-
软件更新:Rocket.Chat、Calibre、Arize Phoenix、Revolt
此集群详细介绍了多个项目的软件更新,包括 Rocket.Chat、Calibre、Arize Phoenix 和 Revolt。值得注意的是,Arize Phoenix 19.19.0 版本包含折叠的 LLM 消息,并将 sqlean.py 依赖项进行了更改。Revolt 0.15.0 版本引入了近似成员计数和呼叫事件功能。
-
LangSmith 和 Arize Phoenix 等 RAG 可观测性工具获得关注
检索增强生成 (RAG) 系统正从实验阶段转向聊天机器人和其他应用程序的关键生产组件。为确保这些系统有效运行,强大的可观测性至关重要。LangSmith 和 Arize Phoenix 等工具被重点介绍为追踪和记录 RAG 操作的关键解决方案,为调试和性能监控提供了必要的洞察。
-
ERPNext、Wekan 和 AI 工具获得更新
ERPNext 发布了 16.30.0 版本,引入了可选的成本中心和逾期限制检查。Wekan 10.50 版本解决了与 Windows zip 文件错误相关的 bug。此外,arize-phoenix v19.10.0 增强了实验指标和代币图表细分,Local Deep Research v1.10.0 集成了 AI 驱动的笔记和统一搜索。
-
OpenSmith 发布本地 LLM 追踪重大更新
OpenSmith,作为 LangSmith 的本地优先替代品,现已发布其 LLM 管道追踪功能的重大更新。新版本拥有重新设计的仪表板,支持实时更新,增强了搜索和过滤功能,并提供了将追踪导出为 JSON、CSV 或 OpenTelemetry 后端选项。它还引入了可选的 PostgreSQL 后端和用于成本管理的 token 预算警报。OpenSmith 旨在提供一个零配置、纯本地的追踪解决方案,已有超过 3.7K 的下载量且未投入营…
-
AI代理评估工具现支持分步分析
评估AI代理已不再局限于检查最终结果。截至2026年7月,新的框架支持分步分析,区分不同类型的失败。这些工具现在可以评估特定方面,如正确的工具选择、参数准确性和路径质量,而不仅仅是整体任务完成情况。这些框架的关键区别在于它们依赖LLM裁判进行这些细粒度评估,还是采用确定性的、基于代码的检查。
-
开源更新:Wekan、Coturn 和 Arize-Phoenix 发布修复补丁
此集群详细介绍了多个开源软件项目的更新。Wekan v10.14 已解决与文件名清理相关的安全漏洞。Coturn 4.15.0 包括对 STUN 属性处理的修复和增强的安全检查。此外,arize-phoenix v19.4.0 改进了 UI 一致性并升级了其 AI SDK spans。
-
AI代理评估工具将焦点从最终答案转移到整个过程
评估AI代理需要一种不同于评估单个LLM调用的方法,重点关注代理的整个过程,而不是仅仅最终输出。LangSmith、Galileo、Arize Phoenix、Braintrust、Future AGI和Langfuse等工具提供了不同的能力,其中一些专注于代理工作流,另一些提供开源可观察性。关键在于不仅要对最终答案进行评分,还要对工具选择、参数和从错误中恢复的序列进行评分,以区分真正的推理和运气。
-
新的代理提供自托管 LLM 的每个代理 GPU 成本跟踪
开发了一个新的 LLM 推理代理,以解决自托管模型时 AI 代理成本可见性的差距。与专注于 token 数量的现有工具不同,该代理跟踪 GPU 小时消耗,提供每个代理和模型的精细成本数据。这有助于在迁移到不同 LLM 之前进行更好的预算管理、模型使用策略执行和影响分析。
-
开发者构建 PII 防火墙以阻止敏感数据进入 LLM 提示
一位开发者为 LLM 交互构建了一个 PII 防火墙,以防止敏感数据发送到云端模型。该系统使用 FastAPI 和 Microsoft Presidio 实现,在提示到达 GPT-4o 等模型之前对其进行扫描,阻止任何包含个人身份信息或违反已定义策略的提示。这种方法通过防止数据泄露(而不仅仅是记录)来确保符合 GDPR 等法规。
-
LLM 可观测性工具忽略语音代理的关键音频层
LLM 的可观测性工具主要关注跟踪模型调用,包括提示、完成和延迟,这对于语音代理来说是不够的。语音代理的失败通常发生在音频层,例如轮次结束检测、ASR 延迟和插入检测,而当前的 LLM 跟踪器无法捕获这些。基于 OpenTelemetry 构建的工具为与 LLM 指标一起检测这些音频层跨度提供了灵活的画布,但需要自定义实现,而其他工具则更侧重于 LLM 调用,需要额外的遥测来提供音频见解。
-
LLM评估工具:确保长期可用性的关键问题
选择LLM评估工具需要仔细考虑,而不仅仅是功能,因为供应商锁定可能成为一个重大问题。文章建议在承诺使用某个工具之前,提出四个关键问题,重点关注长期可用性和数据所有权。关键考虑因素包括工具是否真正支持自托管、企业功能的许可影响以及是否能够轻松导出和保留评估数据集的所有权。
-
LLM可观察性工具地图:LangSmith、Langfuse、Braintrust崭露头角
LLM可观察性领域正在发展,涌现出多种工具来满足监控和理解LLM应用程序的需求。LangSmith、Langfuse、Braintrust、Helicone和Arize Phoenix等关键平台提供了不同的日志记录和衡量LLM性能的方法。有效的日志记录被认为是实现LLM项目可观察性和可衡量性的基础,这对于回答有关生产环境中模型行为的问题至关重要。
-
AI Conf 2026:智能体取代传统机器学习成为行业焦点
2026年莫斯科AI大会强调了行业从传统机器学习向基于智能体的系统(包括RAG和语音智能体)的重大转变。研究人员越来越多地使用LLM来完成代码生成和论文评审辅助等任务,预计未来的出版物将包含可验证的代码存档。会议还展示了智能体框架的进步,例如Deep Agents,该框架利用记忆和技能而非传统的工具编排,并讨论了语音智能体在电话通信中的当前局限性和未来潜力。
-
开发者修复了 Arize Phoenix 中 Anthropic 内存工具的 bug
一位开发者在使用 Arize Phoenix 平台重放 Anthropic 内存工具跨度时遇到了一个问题。该问题表现为 400 错误,表明工具重放功能存在服务器端问题。作者详细介绍了 Arize Phoenix 中的具体 bug,并提供了解决该错误的方案。
-
Hamel Husain 为AI产品团队提供关于选择评估工具和构建健壮系统的建议。
AI顾问Hamel Husain强调,在开发成功的AI产品时,构建健壮的评估系统至关重要,他借鉴了CodeSearchNet和Rechat的AI助手Lucy等项目的经验。他认为,通过有效的评估、调试和修改流程实现的快速迭代是AI产品成功的关键。Husain强调了三个层面的评估:单元测试、模型和人工评估以及A/B测试,并强调简化评估流程对于持续改进至关重要。