PulseAugur
中
实时 18:45:16
实体 langsmith

langsmith

PulseAugur coverage of langsmith — every cluster mentioning langsmith across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
82
90 天内 82
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-25 product_launch Fireworks AI and LangChain are co-hosting a workshop on August 25th focused on building custom evaluation models for LangSmith. 来源
  2. 2026-08-25 product_launch Fireworks and LangChain are co-hosting a workshop to demonstrate building custom evaluation models for LangSmith. 来源
  3. 2026-05-28 product_launch AWS and LangChain released a guide detailing how to use LangSmith on AWS for evaluating AI agents. 来源
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/5 页 · 共 95 条
  1. TOOL · CL_286431 ·

    LangChain 更新 Hugging Face 集成,升级依赖项

    LangChain 发布了其 langchain-huggingface 库的 1.2.3 版本,引入了多项依赖项更新和小的修复。此次发布包括对 LangGraph SDK、fsspec、sentence-transformers、urllib3、tornado、anyio、orjson、Requests、filelock、langsmith、idna 和 aiohttp 等多个库的升级。此外,它还更新了模型配置文件数据,并更改为使用…

  2. TOOL · CL_285610 ·

    7 种生产模式用于训练 AI 代理的详细介绍

    为生产环境训练 AI 代理涉及一个以基础设施和数据为中心的循环过程。关键步骤包括记录每次代理运行以捕获详细跟踪信息,利用这些跟踪信息从真实流量中构建评估数据集,并对这些跟踪信息进行标注以识别失败。该过程强调提示工程存在局限性,并且使用 LoRA 等技术进行微调至关重要,然后在训练前冻结评估集并重复该循环。大部分工作投入在底层基础设施上,而不是代理的核心逻辑上。

  3. TOOL · CL_283207 ·

    AI Agent 框架成本可见性审计揭示了显著的差距

    对五个流行的 AI Agent 框架进行的最新审计显示,在成本可见性和控制方面存在显著差距。虽然 LangGraph(配合 LangSmith)和 Amazon Bedrock AgentCore 等框架提供了强大的代币到美元转换和每个 Agent 的成本跟踪功能,但 CrewAI 和 AutoGen 等其他框架仅提供原始代币使用数据,开发者需要手动计算和归属成本。Strands Agents SDK 提供原生预算上限,但缺乏美元转换…

  4. COMMENTARY · CL_279964 ·

    LLM路由器导致静默质量崩溃,6周内侵蚀用户信任

    LLM路由器虽然能显著节省成本,但可能导致响应质量的静默崩溃,这种崩溃在数周内都不会被察觉。这种退化通常是由Haiku和GPT-4o mini等廉价模型的分类器校准不当或语义漂移引起的,会影响用户信任和留存率。问题在于,质量下降和用户流失之间存在6-7周的滞后,使得标准监控工具难以诊断。解决方案在于在路由器之前或与之并行构建一个强大的评估层,以检测细微的质量变化。

  5. TOOL · CL_279193 ·

    LangSmith 与 MLflow:比较 RAG 应用程序的可观测性工具

    本文比较了 LangSmith 和 MLflow,这两个用于观察和追踪检索增强生成(RAG)应用程序内部操作的平台。文章着重介绍了这两个工具如何为相同的代码和查询提供见解,从不同角度展示应用程序的性能和行为。此次比较旨在帮助用户理解每个平台在 MLOps 方面的优势。

  6. COMMENTARY · CL_277972 ·

    第108期通讯介绍了 ShinyReact、LangSmith 和 RAG Cookbook

    通讯第108期将 ShinyReact 重点介绍为本周的开源项目。它还指出了新的学习资源,包括 LangSmith、专业代理和软件工厂。此外,本期还推荐了一本书:《RAG with Python Cookbook》,作者是 Dominik Polzer。

  7. TOOL · CL_276483 ·

    LangChain 更新 text-splitters 库至 v1.1.3

    LangChain 发布了其 text-splitters 库的 1.1.3 版本,引入了多项依赖更新和小的修复。此次更新包括 tornado、urllib3、anyio 和 lxml 等库的升级,以及类型检查和依赖管理的改进。值得注意的是,对 RecursiveJsonSplitter 进行了修复,以处理非字典输入,并恢复了可选依赖项的惰性导入。

  8. TOOL · CL_274896 ·

    LangSmith 提供LLM可观测性,助力可靠的应用开发

    LangSmith由LangChain开发,是一个可观测性平台,旨在应对调试和监控LLM应用的独特挑战。它提供了追踪执行、评估性能和监控生产环境中应用的工具。该平台能够实时了解LLM API调用、检索操作和代理决策,使开发人员能够精确定位故障并优化性能。LangSmith还支持针对精选数据集系统地评估应用,从而实现性能衡量和回归检测。

  9. TOOL · CL_270641 ·

    LangChain 发布 LangGraph 以实现高级 AI 代理编排

    LangGraph 是 LangChain 团队开发的一个新的编排框架,用于构建复杂的、有状态的 AI 代理和工作流。它将执行建模为在共享的、类型化的状态上运行的节点和边的图,支持循环、条件分支和人工干预等功能。LangGraph 借鉴了 Google 的 Pregel 和 Apache Beam 等系统的思想,专注于管理执行流程、状态持久化和多代理协调,为长期运行或重要的代理任务提供了比简单线性链更强大的解决方案。

  10. TOOL · CL_256243 ·

    Maxim AI 在 LLM 可观测性工具领域领先,应对无声 AI 故障 · 跟踪 2 个来源

    根据近期分析,Maxim AI 已成为 2026 年 LLM 可观测性领域的领先平台。这是因为它能够将生产监控与部署前模拟和评估相结合,弥合工程和产品团队之间的差距。传统的应用程序性能监控 (APM) 工具对于 AI 应用程序来说是不够的,因为它们无法检测到无声故障,例如幻觉或上下文漂移,这些故障尽管有标准的 HTTP 200 响应但仍然发生。Langfuse、LangSmith 和 Arize AI 等替代解决方案为特定的架构需求提…

  11. TOOL · CL_254107 ·

    LangSmith 平台提供 AI 应用的可观测性和监控

    LangSmith 是一个专为监控和观察 AI 应用而设计的新平台,由 LangChain 和 LangGraph 的创建者开发。它区分了可观测性(跟踪单个组件的输入和输出来诊断问题)和监控(关注延迟和成本等整体系统指标)。由于 LLM 应用的非确定性,这种区分至关重要,使得传统的调试方法不足以应对。

  12. TOOL · CL_247577 ·

    开发者分享必备 AI 产品构建工具包

    一位开发者分享了他们用于快速构建 AI 产品的工具列表。该工具包包括用于流式传输和工具调用的 Vercel AI SDK、用于 LLM 跟踪和评估的 LangSmith,以及用于用量分析的 Helicone。其他推荐用于高效 AI 开发的工具包括用于后台作业的 Inngest、用于 Redis 和速率限制的 Upstash,以及用于工作流自动化的 Trigger.dev。

  13. TOOL · CL_244053 ·

    LangChain 通过 Deep Agents 简化代理创建;Cognous 添加安全防护

    LangChain 推出了 Managed Deep Agents,这是一个旨在通过提供用于工具使用、上下文管理和任务委托的“线束”来简化 AI 代理创建的框架。该系统旨在为开发人员节省构建代理的时间和精力,并展示了一个用于供应链分析的用例,其中一个代理识别出有缺货风险的 SKU 并起草警报电子邮件。此外,Cognous 开发了 Open Control Stack,这是一个开源框架,解决了代理安全防护的关键需求,以防止意外的破坏性操…

  14. TOOL · CL_243602 ·

    AI代理框架缺乏关键审计字段以提供证据,研究发现

    对六个流行AI代理框架的最新审计显示,其在用于取证的日志记录能力方面存在重大缺陷。研究人员于2026年9月4日发现,中位数框架仅记录了十二个强制审计字段中的五个,没有一个框架实现了类似哈希链的防篡改字段。这种强大的日志记录缺失意味着当前主要为调试设计的代理跟踪无法可靠地证明AI代理已执行的操作,从而引发了对问责制和信任的担忧。

  15. TOOL · CL_242759 ·

    LangGraph 指南解释如何构建多代理 AI 系统

    该存储库提供了使用 LangGraph 构建多代理系统的全面指南,从基本概念到功能齐全的双代理管道。它详细介绍了设置过程,包括为 Groq、Tavily 和 LangSmith 等服务配置凭据,并解释了核心 LangGraph 组件,如状态、节点和边。该指南强调实际应用,包含一个带有工具和 ReAct 循环的多代理项目,并根据开发过程中遇到的实际错误提供故障排除技巧。

  16. TOOL · CL_239161 ·

    LLM 可观测性必须跟踪 RAG 证据管道,而不仅仅是模型调用

    检索增强生成 (RAG) 系统的可观测性需要超越标准的 LLM 跟踪,以包含完整的证据路径。当前的 LLM 可观测性通常侧重于模型调用,掩盖了检索过程中的失败,例如错误的查询重写、过时的信息或被丢弃的相关段落。全面的跟踪应将原始问题与有效查询、检索到的来源、选定的证据和最终声明联系起来,以准确诊断为什么答案可能错误,即使模型调用本身看起来是成功的。

  17. COMMENTARY · CL_230355 ·

    LLM可观测性工具捕获数据但未能判断代理输出质量

    文章讨论了LLM基础设施的演变,从直接的供应商SDK转向LLM网关和专用可观测性堆栈。虽然LiteLLM和Portkey等网关简化了模型切换,但Langfuse和LangSmith等可观测性工具捕获了详细的跟踪数据。然而,作者认为,当前的可观测性解决方案侧重于观察代理行为,而不是评估其输出的质量或正确性,这在理解代理性能方面留下了关键的空白。

  18. TOOL · CL_222247 ·

    发布工程领域排名前五的LLM评估框架排名

    最近的一项分析强调,Promptfoo是发布工程领域领先的LLM评估框架,尤其因其能够阻止构建失败测试的CI/CD集成而备受关注。DeepEval推荐用于基于Python的测试套件,并提供与pytest的无缝集成。LangSmith因其强大的托管可追溯性和实验历史而受到关注,适合优先考虑详细记录的团队。OpenAI Evals因其可重用的评估规范而受到认可,而Ragas则被确定为评估检索增强生成(RAG)质量的专业工具。评估标准侧重于…

  19. TOOL · CL_217512 ·

    Fireworks 和 LangChain 主办关于 LangSmith 评估模型的研讨会

    Fireworks 和 LangChain 将于 8 月 25 日联合举办一个关于为 LangSmith 构建自定义评估模型的研讨会。本次活动旨在帮助与会者扩展其可观测性堆栈以提高性能。研讨会后将有屋顶欢乐时光。

  20. TOOL · CL_215030 ·

    ZizkaDB 推出用于调试 LLM 代理决策链

    ZizkaDB 已推出,这是一个开源的操作型数据库,旨在解决 LLM 代理的调试挑战。与提供事件跨度树的传统跟踪工具不同,ZizkaDB 将代理决策存储为图,明确地将事件与其原因联系起来。这种因果链使开发人员能够理解代理输出背后的“为什么”,而不仅仅是“什么”和“何时”。该系统还提供会话级回放和漂移检测,其自托管设置仅需一个脚本和一个用于集成的 Python SDK。