PulseAugur
实时 14:53:47
实体 langsmith

langsmith

PulseAugur coverage of langsmith — every cluster mentioning langsmith across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
19
90 天内 76
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-28 product_launch AWS and LangChain released a guide detailing how to use LangSmith on AWS for evaluating AI agents. 来源
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/4 页 · 共 76 条
  1. TOOL · CL_215030 ·

    ZizkaDB 推出用于调试 LLM 代理决策链

    ZizkaDB 已推出,这是一个开源的操作型数据库,旨在解决 LLM 代理的调试挑战。与提供事件跨度树的传统跟踪工具不同,ZizkaDB 将代理决策存储为图,明确地将事件与其原因联系起来。这种因果链使开发人员能够理解代理输出背后的“为什么”,而不仅仅是“什么”和“何时”。该系统还提供会话级回放和漂移检测,其自托管设置仅需一个脚本和一个用于集成的 Python SDK。

  2. TOOL · CL_209894 ·

    LangChain 更新 Anthropic 集成,新增功能并修复问题

    LangChain 发布了其 Anthropic 集成的两个新版本:1.6.1 和 1.6.0。版本 1.6.1 包含一项修复,用于过滤来自 Anthropic v1 内容的无效工具调用。版本 1.6.0 在 1.6.1 之前发布,为核心库引入了标准的模型异常类型,并修复了在 Anthropic 集成中排除兄弟目录的 grep 搜索范围的问题,同时还增加了对 CI 中 LangSmith 网关的支持。

  3. TOOL · CL_209388 ·

    LangSmith 添加了 Tuned Evaluators 以改进 AI 代理质量反馈

    LangSmith 推出了 Tuned Evaluators 功能,旨在通过将特定的质量指标附加到生产跟踪中来增强 AI 代理的质量反馈循环。最初,此功能侧重于“感知错误”,以帮助团队识别和纠正 AI 代理的错误。此举旨在提高 AI 系统在实际应用中的可靠性和性能。

  4. COMMENTARY · CL_207129 ·

    LLM 可观测性工具出现分化,专注于不同的核心问题

    LLM 可观测性领域正在多元化,LangSmith、Langfuse、Braintrust Ai 和 Helicone 等工具各自专注于不同的核心问题,而不是直接竞争。LangSmith 强调对 LangChain 和 LangGraph 代理执行进行跟踪,而 Langfuse 则提供了一个框架无关的开源解决方案,用于跟踪和评估。Braintrust Ai 优先考虑评估,将分数视为主要对象,而 Helicone 则通过关注 API 流…

  5. TOOL · CL_205540 ·

    LangChain 将 OpenAI 集成更新至 v1.5.2,包含新功能和修复

    LangChain 发布了其 langchain-openai 包的 1.5.2 版本,引入了多项修复和功能。主要更新包括保留推理项边界、从响应头中提取网关元数据以及支持 token 计数中的 'o-series' 模型。此次发布还包括一个初步版本 1.5.2a1,标志着此特定 alpha 版本的首次发布。

  6. TOOL · CL_198945 ·

    LangChain 更新 OpenAI 集成至 v1.5.1,修复推理错误

    LangChain 发布了其 langchain-openai 集成的 1.5.1 版本,紧随 1.5.0 版本之后。最新的 1.5.1 更新专注于修复流式加密推理未被保留的问题。1.5.0 版本引入了对 OpenAI 3.0 SDK 的支持,并更新了 langgraph 和 Hugging Face 集成的锁定文件。

  7. TOOL · CL_197148 ·

    Fireworks AI 和 LangChain 举办定制评估模型研讨会

    Fireworks AI 将于8月25日与 LangChain 合作举办一场研讨会。活动将重点关注为 LangSmith 构建定制评估模型,并增强可观测性堆栈以提高性能。与会者还有机会在研讨会后参加屋顶欢乐时光。

  8. TOOL · CL_195377 ·

    LangChain 发布核心组件和主库更新

    LangChain 已发布其核心组件和主库的更新。Langchain-core 1.5.5 版本包括对 pydantic 验证、合并块和处理 Anthropic 内容块的修复,以及对 httpx 的显式依赖。主 LangChain 库 1.3.15 版本为代理和工具引入了新的中间件功能,改进了摘要和工具模拟的错误处理,并增强了与 LangSmith 的集成。这些更新还解决了各种依赖项的升级和内部重构。

  9. SIGNIFICANT · CL_190633 ·

    随着市场蓬勃发展,LLM 可观测性平台在高级功能上出现分化

    LLM 可观测性和评估平台市场正在迅速扩张,预计到 2030 年将达到 92.6 亿美元。平台正朝着 AI 原生工具、开源评估库、AI 网关和 APM 扩展等方向多元化发展,并且越来越多地采用 OpenTelemetry 标准以实现互操作性。Langfuse、Helicone、Opik 和 MLflow 等领先平台之间的关键差异化因素在于其高级功能,例如自动跟踪评分、复杂的速率限制规则、用于主题和 PII 检测的集成防护栏,以及具有差…

  10. TOOL · CL_187745 ·

    LLM 可观测性工具捕获追踪但限制断言粒度

    用于 LLM Agent 的可观测性工具,如 Langfuse、LangSmith 和 Phoenix,提供了捕获生产追踪的方法,但它们在定义输入和断言方面的默认配置可能有限制性。作者认为,捕获 Agent 的失败需要将输入定义为失败点的状态,而不仅仅是初始用户消息,并且断言槽通常捕获单个输出,而不是工具调用的完整轨迹。DeepEval 被强调为一个例外,它提供了可以直接对工具调用序列进行断言建模的模式。

  11. TOOL · CL_186887 ·

    LangSmith 和 Arize Phoenix 等 RAG 可观测性工具获得关注

    检索增强生成 (RAG) 系统正从实验阶段转向聊天机器人和其他应用程序的关键生产组件。为确保这些系统有效运行,强大的可观测性至关重要。LangSmith 和 Arize Phoenix 等工具被重点介绍为追踪和记录 RAG 操作的关键解决方案,为调试和性能监控提供了必要的洞察。

  12. TOOL · CL_180041 ·

    OpenAI收购Promptfoo引发对LLM评估独立性的辩论

    OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。

  13. TOOL · CL_176434 ·

    新工具将代理失败转换为微调数据

    一款名为 trace2train 的新开源工具已发布,可将失败的代理追踪转换为监督微调 (SFT) 或直接偏好优化 (DPO) 训练数据。该工具作为本地 CLI 工具开发,旨在利用代理错误(例如不正确的工具选择或错误的参数),这些错误通常会丢失在日志中,以改进模型。该工具支持 LangSmith 和 Langfuse 等各种追踪源,并可利用 DeepSeek 或 OpenAI 等模型进行处理,同时通过仅在可从追踪中推导出的情况下生成更…

  14. TOOL · CL_174855 ·

    LangSmith LLM Gateway 在运行时增加了支出限制和 PII 屏蔽功能

    LangSmith 的新 LLM Gateway 为 AI 代理提供运行时治理,解决了预算和合规性风险。它直接集成到代理和 LLM 提供商之间的请求路径中,支持诸如硬性支出限制(在超出预算前停止 API 调用)和 PII 屏蔽(用于屏蔽提示和跟踪中的敏感数据)等功能。这种方法旨在防止成本失控和数据泄露,而无需重写现有代理逻辑,并通过屏蔽的跟踪保留完整的可观察性。

  15. TOOL · CL_169459 ·

    LangChain 生态系统解析:构建模块 vs. 运营工具

    由于命名相似的工具激增,LLM 开发生态系统正经历“Lang 疲劳”。本指南阐明了 LangChain、LangGraph 和 Langfuse 等开源构建模块与 LangSmith 等商业平台工具之间的区别。LangChain 提供具有预构建模式的高级代理构建,而 LangGraph 则为复杂的循环逻辑和人工干预能力提供低级、有状态的编排。LangSmith 作为大规模运行代理的运营层,提供可观测性和部署功能。

  16. TOOL · CL_168886 ·

    大型语言模型提示词修改绕过测试,导致准确率显著下降

    在对系统提示词进行了一个微小的单词修改后,大型语言模型提取准确率从0.87显著下降到0.78。这暴露了当前大型语言模型应用开发中的一个关键漏洞:提示词的更改通常会绕过代码所经历的严格测试和验证。作者提倡在持续集成(CI)管道中实施一个“提示词回归门”,其中包括一个固定的评估数据集、一个一致的评分指标和一个增量阈值,以防止有害的提示词修改。

  17. TOOL · CL_164195 ·

    OpenSmith 发布本地 LLM 追踪重大更新

    OpenSmith,作为 LangSmith 的本地优先替代品,现已发布其 LLM 管道追踪功能的重大更新。新版本拥有重新设计的仪表板,支持实时更新,增强了搜索和过滤功能,并提供了将追踪导出为 JSON、CSV 或 OpenTelemetry 后端选项。它还引入了可选的 PostgreSQL 后端和用于成本管理的 token 预算警报。OpenSmith 旨在提供一个零配置、纯本地的追踪解决方案,已有超过 3.7K 的下载量且未投入营…

  18. TOOL · CL_162547 ·

    开发者分享20分钟LLM代理模型更换测试方法

    一位开发者分享了一个20分钟的流程,用于测试LLM代理模型更换,以防止细微的行为回归。该方法包括在使用`whatbroke-cli`工具记录特定场景下代理的基线行为,然后在更换模型前后进行对比。差异分析会突出显示关键问题,如工具调用丢失或参数漂移,这些问题可以集成到CI管道中进行自动化检查。这种方法旨在捕捉那些仅通过审查代理回复可能忽略的问题,因为即使底层功能出现故障,代理回复通常看起来也正常。

  19. TOOL · CL_160592 ·

    智能体AI编排为实时欺诈检测系统提供动力

    本文详细介绍了生产级智能体欺诈检测系统的架构,重点关注多个AI智能体和人工干预工作流的集成。它强调超越简单的模型性能指标,在可信赖且可审计的系统中实现实时决策。该系统使用LangGraph进行智能体编排,LangSmith进行追踪,并部署在AWS上,后端为FastAPI,前端为Streamlit。

  20. TOOL · CL_155788 ·

    LangChain 更新 Anthropic 集成,新增 Claude Opus 4.8 结构化输出

    LangChain 发布了其 Anthropic 集成的更新,其中 1.5.1 和 1.5.0 版本引入了多项增强功能。1.5.1 版本特别为 Claude Opus 4.8 启用了结构化输出,并通过环境变量支持 LangSmith 网关,这也使 Fireworks 和 OpenAI 集成受益。1.5.0 版本为聊天模型添加了标准的 `reasoning_effort` 参数,并改进了 Anthropic 的工具识别功能。