langsmith
PulseAugur coverage of langsmith — every cluster mentioning langsmith across labs, papers, and developer communities, ranked by signal.
- acquired by Promptfoo 95%
- developed by langchain-openai 90%
- competes with Langfuse 70%
- competes with Helicone 70%
- competes with Braintrust Ai 70%
- competes with DeepEval 70%
- competes with Arize Phoenix 70%
- used by Promptfoo 70%
- competes with Ragas 70%
- affiliated with langchain-core 70%
- used by vcrpy 70%
- competes with Phoenix 70%
- 2026-05-28 product_launch AWS and LangChain released a guide detailing how to use LangSmith on AWS for evaluating AI agents. 来源
14 天有情绪数据
-
ZizkaDB 推出用于调试 LLM 代理决策链
ZizkaDB 已推出,这是一个开源的操作型数据库,旨在解决 LLM 代理的调试挑战。与提供事件跨度树的传统跟踪工具不同,ZizkaDB 将代理决策存储为图,明确地将事件与其原因联系起来。这种因果链使开发人员能够理解代理输出背后的“为什么”,而不仅仅是“什么”和“何时”。该系统还提供会话级回放和漂移检测,其自托管设置仅需一个脚本和一个用于集成的 Python SDK。
-
LangChain 更新 Anthropic 集成,新增功能并修复问题
LangChain 发布了其 Anthropic 集成的两个新版本:1.6.1 和 1.6.0。版本 1.6.1 包含一项修复,用于过滤来自 Anthropic v1 内容的无效工具调用。版本 1.6.0 在 1.6.1 之前发布,为核心库引入了标准的模型异常类型,并修复了在 Anthropic 集成中排除兄弟目录的 grep 搜索范围的问题,同时还增加了对 CI 中 LangSmith 网关的支持。
-
LangSmith 添加了 Tuned Evaluators 以改进 AI 代理质量反馈
LangSmith 推出了 Tuned Evaluators 功能,旨在通过将特定的质量指标附加到生产跟踪中来增强 AI 代理的质量反馈循环。最初,此功能侧重于“感知错误”,以帮助团队识别和纠正 AI 代理的错误。此举旨在提高 AI 系统在实际应用中的可靠性和性能。
-
LLM 可观测性工具出现分化,专注于不同的核心问题
LLM 可观测性领域正在多元化,LangSmith、Langfuse、Braintrust Ai 和 Helicone 等工具各自专注于不同的核心问题,而不是直接竞争。LangSmith 强调对 LangChain 和 LangGraph 代理执行进行跟踪,而 Langfuse 则提供了一个框架无关的开源解决方案,用于跟踪和评估。Braintrust Ai 优先考虑评估,将分数视为主要对象,而 Helicone 则通过关注 API 流…
-
LangChain 将 OpenAI 集成更新至 v1.5.2,包含新功能和修复
LangChain 发布了其 langchain-openai 包的 1.5.2 版本,引入了多项修复和功能。主要更新包括保留推理项边界、从响应头中提取网关元数据以及支持 token 计数中的 'o-series' 模型。此次发布还包括一个初步版本 1.5.2a1,标志着此特定 alpha 版本的首次发布。
-
LangChain 更新 OpenAI 集成至 v1.5.1,修复推理错误
LangChain 发布了其 langchain-openai 集成的 1.5.1 版本,紧随 1.5.0 版本之后。最新的 1.5.1 更新专注于修复流式加密推理未被保留的问题。1.5.0 版本引入了对 OpenAI 3.0 SDK 的支持,并更新了 langgraph 和 Hugging Face 集成的锁定文件。
-
Fireworks AI 和 LangChain 举办定制评估模型研讨会
Fireworks AI 将于8月25日与 LangChain 合作举办一场研讨会。活动将重点关注为 LangSmith 构建定制评估模型,并增强可观测性堆栈以提高性能。与会者还有机会在研讨会后参加屋顶欢乐时光。
-
LangChain 发布核心组件和主库更新
LangChain 已发布其核心组件和主库的更新。Langchain-core 1.5.5 版本包括对 pydantic 验证、合并块和处理 Anthropic 内容块的修复,以及对 httpx 的显式依赖。主 LangChain 库 1.3.15 版本为代理和工具引入了新的中间件功能,改进了摘要和工具模拟的错误处理,并增强了与 LangSmith 的集成。这些更新还解决了各种依赖项的升级和内部重构。
-
随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化
LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…
-
LLM 可观测性工具捕获追踪但限制断言粒度
用于 LLM Agent 的可观测性工具,如 Langfuse、LangSmith 和 Phoenix,提供了捕获生产追踪的方法,但它们在定义输入和断言方面的默认配置可能有限制性。作者认为,捕获 Agent 的失败需要将输入定义为失败点的状态,而不仅仅是初始用户消息,并且断言槽通常捕获单个输出,而不是工具调用的完整轨迹。DeepEval 被强调为一个例外,它提供了可以直接对工具调用序列进行断言建模的模式。
-
LangSmith 和 Arize Phoenix 等 RAG 可观测性工具获得关注
检索增强生成 (RAG) 系统正从实验阶段转向聊天机器人和其他应用程序的关键生产组件。为确保这些系统有效运行,强大的可观测性至关重要。LangSmith 和 Arize Phoenix 等工具被重点介绍为追踪和记录 RAG 操作的关键解决方案,为调试和性能监控提供了必要的洞察。
-
OpenAI收购Promptfoo引发对LLM评估独立性的辩论
OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。
-
新工具将代理失败转换为微调数据
一款名为 trace2train 的新开源工具已发布,可将失败的代理追踪转换为监督微调 (SFT) 或直接偏好优化 (DPO) 训练数据。该工具作为本地 CLI 工具开发,旨在利用代理错误(例如不正确的工具选择或错误的参数),这些错误通常会丢失在日志中,以改进模型。该工具支持 LangSmith 和 Langfuse 等各种追踪源,并可利用 DeepSeek 或 OpenAI 等模型进行处理,同时通过仅在可从追踪中推导出的情况下生成更…
-
LangSmith LLM Gateway 在运行时增加了支出限制和 PII 屏蔽功能
LangSmith 的新 LLM Gateway 为 AI 代理提供运行时治理,解决了预算和合规性风险。它直接集成到代理和 LLM 提供商之间的请求路径中,支持诸如硬性支出限制(在超出预算前停止 API 调用)和 PII 屏蔽(用于屏蔽提示和跟踪中的敏感数据)等功能。这种方法旨在防止成本失控和数据泄露,而无需重写现有代理逻辑,并通过屏蔽的跟踪保留完整的可观察性。
-
LangChain 生态系统解析:构建模块 vs. 运营工具
由于命名相似的工具激增,LLM 开发生态系统正经历“Lang 疲劳”。本指南阐明了 LangChain、LangGraph 和 Langfuse 等开源构建模块与 LangSmith 等商业平台工具之间的区别。LangChain 提供具有预构建模式的高级代理构建,而 LangGraph 则为复杂的循环逻辑和人工干预能力提供低级、有状态的编排。LangSmith 作为大规模运行代理的运营层,提供可观测性和部署功能。
-
大型语言模型提示词修改绕过测试,导致准确率显著下降
在对系统提示词进行了一个微小的单词修改后,大型语言模型提取准确率从0.87显著下降到0.78。这暴露了当前大型语言模型应用开发中的一个关键漏洞:提示词的更改通常会绕过代码所经历的严格测试和验证。作者提倡在持续集成(CI)管道中实施一个“提示词回归门”,其中包括一个固定的评估数据集、一个一致的评分指标和一个增量阈值,以防止有害的提示词修改。
-
OpenSmith 发布本地 LLM 追踪重大更新
OpenSmith,作为 LangSmith 的本地优先替代品,现已发布其 LLM 管道追踪功能的重大更新。新版本拥有重新设计的仪表板,支持实时更新,增强了搜索和过滤功能,并提供了将追踪导出为 JSON、CSV 或 OpenTelemetry 后端选项。它还引入了可选的 PostgreSQL 后端和用于成本管理的 token 预算警报。OpenSmith 旨在提供一个零配置、纯本地的追踪解决方案,已有超过 3.7K 的下载量且未投入营…
-
开发者分享20分钟LLM代理模型更换测试方法
一位开发者分享了一个20分钟的流程,用于测试LLM代理模型更换,以防止细微的行为回归。该方法包括在使用`whatbroke-cli`工具记录特定场景下代理的基线行为,然后在更换模型前后进行对比。差异分析会突出显示关键问题,如工具调用丢失或参数漂移,这些问题可以集成到CI管道中进行自动化检查。这种方法旨在捕捉那些仅通过审查代理回复可能忽略的问题,因为即使底层功能出现故障,代理回复通常看起来也正常。
-
智能体AI编排为实时欺诈检测系统提供动力
本文详细介绍了生产级智能体欺诈检测系统的架构,重点关注多个AI智能体和人工干预工作流的集成。它强调超越简单的模型性能指标,在可信赖且可审计的系统中实现实时决策。该系统使用LangGraph进行智能体编排,LangSmith进行追踪,并部署在AWS上,后端为FastAPI,前端为Streamlit。
-
LangChain 更新 Anthropic 集成,新增 Claude Opus 4.8 结构化输出
LangChain 发布了其 Anthropic 集成的更新,其中 1.5.1 和 1.5.0 版本引入了多项增强功能。1.5.1 版本特别为 Claude Opus 4.8 启用了结构化输出,并通过环境变量支持 LangSmith 网关,这也使 Fireworks 和 OpenAI 集成受益。1.5.0 版本为聊天模型添加了标准的 `reasoning_effort` 参数,并改进了 Anthropic 的工具识别功能。