Arize Phoenix
PulseAugur coverage of Arize Phoenix — every cluster mentioning Arize Phoenix across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
开源更新:Wekan、Coturn 和 Arize-Phoenix 发布修复补丁
此集群详细介绍了多个开源软件项目的更新。Wekan v10.14 已解决与文件名清理相关的安全漏洞。Coturn 4.15.0 包括对 STUN 属性处理的修复和增强的安全检查。此外,arize-phoenix v19.4.0 改进了 UI 一致性并升级了其 AI SDK spans。
-
AI代理评估工具将焦点从最终答案转移到整个过程
评估AI代理需要一种不同于评估单个LLM调用的方法,重点关注代理的整个过程,而不是仅仅最终输出。LangSmith、Galileo、Arize Phoenix、Braintrust、Future AGI和Langfuse等工具提供了不同的能力,其中一些专注于代理工作流,另一些提供开源可观察性。关键在于不仅要对最终答案进行评分,还要对工具选择、参数和从错误中恢复的序列进行评分,以区分真正的推理和运气。
-
新的代理提供自托管 LLM 的每个代理 GPU 成本跟踪
开发了一个新的 LLM 推理代理,以解决自托管模型时 AI 代理成本可见性的差距。与专注于 token 数量的现有工具不同,该代理跟踪 GPU 小时消耗,提供每个代理和模型的精细成本数据。这有助于在迁移到不同 LLM 之前进行更好的预算管理、模型使用策略执行和影响分析。
-
开发者构建 PII 防火墙以阻止敏感数据进入 LLM 提示
一位开发者为 LLM 交互构建了一个 PII 防火墙,以防止敏感数据发送到云端模型。该系统使用 FastAPI 和 Microsoft Presidio 实现,在提示到达 GPT-4o 等模型之前对其进行扫描,阻止任何包含个人身份信息或违反已定义策略的提示。这种方法通过防止数据泄露(而不仅仅是记录)来确保符合 GDPR 等法规。
-
LLM 可观测性工具忽略语音代理的关键音频层
LLM 的可观测性工具主要关注跟踪模型调用,包括提示、完成和延迟,这对于语音代理来说是不够的。语音代理的失败通常发生在音频层,例如轮次结束检测、ASR 延迟和插入检测,而当前的 LLM 跟踪器无法捕获这些。基于 OpenTelemetry 构建的工具为与 LLM 指标一起检测这些音频层跨度提供了灵活的画布,但需要自定义实现,而其他工具则更侧重于 LLM 调用,需要额外的遥测来提供音频见解。
-
LLM评估工具:确保长期可用性的关键问题
选择LLM评估工具需要仔细考虑,而不仅仅是功能,因为供应商锁定可能成为一个重大问题。文章建议在承诺使用某个工具之前,提出四个关键问题,重点关注长期可用性和数据所有权。关键考虑因素包括工具是否真正支持自托管、企业功能的许可影响以及是否能够轻松导出和保留评估数据集的所有权。
-
LLM可观察性工具地图:LangSmith、Langfuse、Braintrust崭露头角
LLM可观察性领域正在发展,涌现出多种工具来满足监控和理解LLM应用程序的需求。LangSmith、Langfuse、Braintrust、Helicone和Arize Phoenix等关键平台提供了不同的日志记录和衡量LLM性能的方法。有效的日志记录被认为是实现LLM项目可观察性和可衡量性的基础,这对于回答有关生产环境中模型行为的问题至关重要。
-
AI Conf 2026:智能体取代传统机器学习成为行业焦点
2026年莫斯科AI大会强调了行业从传统机器学习向基于智能体的系统(包括RAG和语音智能体)的重大转变。研究人员越来越多地使用LLM来完成代码生成和论文评审辅助等任务,预计未来的出版物将包含可验证的代码存档。会议还展示了智能体框架的进步,例如Deep Agents,该框架利用记忆和技能而非传统的工具编排,并讨论了语音智能体在电话通信中的当前局限性和未来潜力。
-
开发者修复了 Arize Phoenix 中 Anthropic 内存工具的 bug
一位开发者在使用 Arize Phoenix 平台重放 Anthropic 内存工具跨度时遇到了一个问题。该问题表现为 400 错误,表明工具重放功能存在服务器端问题。作者详细介绍了 Arize Phoenix 中的具体 bug,并提供了解决该错误的方案。
-
Hamel Husain 为AI产品团队提供关于选择评估工具和构建健壮系统的建议。
AI顾问Hamel Husain强调,在开发成功的AI产品时,构建健壮的评估系统至关重要,他借鉴了CodeSearchNet和Rechat的AI助手Lucy等项目的经验。他认为,通过有效的评估、调试和修改流程实现的快速迭代是AI产品成功的关键。Husain强调了三个层面的评估:单元测试、模型和人工评估以及A/B测试,并强调简化评估流程对于持续改进至关重要。