tool calling
PulseAugur coverage of tool calling — every cluster mentioning tool calling across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
使用模型上下文协议构建银行AI助手
本文详细介绍了使用模型上下文协议(MCP)开发银行AI助手。文章探讨了从传统的工具调用方法到MCP的转变,强调了在银行业创建更复杂的AI应用的优势和实际实现。
-
新的CorrGRPO方法增强了语言模型的多元奖励学习
研究人员推出了一种名为相关性归一化GRPO(CorrGRPO)的新方法,用于训练具有多个奖励信号的推理语言模型。这种新方法解决了标准组相对策略优化(GRPO)中大规模奖励可能掩盖较小奖励的局限性。CorrGRPO将成对协方差归一化为皮尔逊相关系数,确保不同奖励成分的影响更加均衡。该方法已在0.5B到8B参数的模型上,在代码生成、工具调用和代理安全任务中展现出改进。
-
新的 Node.js 库可保护 LLM API 调用免受间歇性 JSON 错误的影响
一个名为 `@coder12-z/llm-shield` 的新 Node.js 库已被开发出来,用于解决与 OpenAI 的 GPT-4o mini、Anthropic 和 Gemini 等大型语言模型交互时出现的间歇性 JSON 解析错误。这些错误通常源于网络损坏、流截断或格式错误的模型输出,可能导致请求意外失败。`llm-shield` 库提供了一个简洁的解决方案,只需少量配置即可自动处理重试和清理工具调用参数,从而防止常见的 `…
-
AI 代理:理解工作流、工具调用和隐藏的逻辑漏洞
本文深入探讨了 AI 代理的细微差别,区分了简单的工作流和能够进行工具调用的更复杂的代理。它强调了 AI 代理如何陷入循环,并探讨了在 AI 结对编程中可能出现的微妙逻辑漏洞,其中生成的代码可能看起来正确但包含隐藏的行为错误。
-
AI产品技术:工具调用、MCP、代理、工作流和RAG详解
文章解释了包括工具调用、MCP(模型中心编程)、代理、工作流和检索增强生成(RAG)在内的各种AI技术如何在AI产品中相互关联并经常一起使用。它旨在阐明这些概念之间的区别和重叠之处,表明它们并非完全独立,而是构建复杂AI应用程序的互补组成部分。
-
Python 教程详细介绍 Text-to-SQL 代理,将工具定义与其实现分开
本教程演示了如何通过将工具定义与其实现分离开来,在 Python 中构建一个 Text-to-SQL 代理。该方法涉及将模型详细信息、系统提示和数据库模式放在仪表板中以便于修改,而只有数据库查询和列验证等操作的 Python 函数体保留在代码存储库中。这种分离允许提示工程师在不进行代码部署的情况下更新工具描述,尽管这需要仔细对齐这两个信息源。
-
开发者可以通过了解 token 定价和成本节约机制来估算 LLM API 成本
估算使用大型语言模型 (LLM) API 的成本需要了解其定价基于 token,其中输出 token 的成本远高于输入 token。开发者可以使用一个考虑输入和输出 token 数量及其每百万 token 的相应价格的公式来计算基本成本。然而,由于重试、工具调用往返和扩展推理等因素,实际成本可能会更高,因此需要比初始估算高出 20-50% 的缓冲。降低成本的关键措施包括为不同任务选择合适的模型、限制输出长度、实施 prompt 缓存以…
-
新的基准测试 ToolRobustBench 诊断 LLM 工具调用失败
研究人员推出了 ToolRobustBench,这是一个新的基准测试,旨在评估和诊断工具调用代理的失败情况。工具调用代理是使用外部工具完成任务的 LLM 系统。该基准测试系统地引入了四类扰动——工具接口、用户意图、工具输出/观察和运行时环境——以查明工具使用流程中的具体失败点。涉及多个 LLM 和工具的实验揭示了鲁棒性显著下降,其中工具输出/观察扰动被确定为主要瓶颈,凸显了对更鲁棒的工具调用能力的需求。
-
大型语言模型 API 集成:从演示走向稳健的生产系统
本文讨论了将大型语言模型 (LLM) 与实际 API 集成的挑战和最佳实践,旨在从基本演示走向稳健的生产系统。文章强调应将 LLM API 交互视为一种为智能但可能鲁莽的实习生设计的 API,并着重指出对模型生成的参数进行严格的运行时验证的必要性。作者提倡采用一种“先模式”的方法,使用 Zod 等工具来定义和验证参数,确保业务规则通过编程强制执行,而不是仅仅依赖提示。此外,文章还强调了根据上下文、对话状态以及读/写分离来仔细限定 LL…
-
LLM代理通过新的“代码模式”方法大幅减少令牌使用量
一种名为“代码模式”的新方法旨在显著减少大型语言模型在与多个工具交互时所需的令牌数量。代码模式允许LLM生成一个直接调用必要工具的脚本,而不是将所有工具定义和中间结果串行化到模型的上下文窗口中。然后,该脚本在一个安全的沙箱中执行,只有最终输出会返回给模型。这种方法在某些任务中已证明可将上下文令牌使用量减少99%以上,从而解决了传统工具调用方法的扩展性问题。
-
Liquid AI发布了能够支持手机上128K上下文的2.6B模型
Liquid AI发布了LFM2.5-2.6B,这是一款专为本地AI应用设计的紧凑型语言模型。尽管其参数量仅为26.9亿,但该模型拥有128K的上下文窗口并支持工具调用,使其适用于多步代理工作流。初步基准测试表明,在特定任务上,其性能可与Qwen3.5-9B等更大模型相媲美,尽管编码和知识密集型工作仍有改进空间。该模型的效率得到了其报告速度的体现,包括在手机上达到30 tokens/秒的速度和低于2.5 GB的内存使用量,这表明其在设…
-
Google 的 A2A 协议在代理间通信中找到利基市场
Google 的 Agent2Agent (A2A) 协议于 2025 年 4 月推出,旨在标准化来自不同供应商和框架的独立 AI 代理之间的通信。最初因市场充斥着缩略语以及与模型上下文协议 (MCP) 的感知重叠而受到怀疑,A2A 在 2026 年找到了其利基市场。它被证明对于在具有自身所有权和能力的独立代理之间实现通信非常有用,而不仅仅是内部功能或工具包装器。该协议促进代理发现、任务委托、消息交换和工件共享,解决了代理协作的完整生命周期。
-
新的强化学习方法增强大型语言模型训练的稳定性和效率 · 跟踪 7 个来源
研究人员开发了几种新方法来提高大型语言模型 (LLM) 中强化学习 (RL) 的稳定性和效率。STARE 通过根据惊奇度重新加权 token 级优势来解决策略熵崩溃问题,在推理基准测试中显示出更高的准确性。GrowthHacker 利用 LLM 代理自主优化离策略评估 (OPE) 代码,证明了改进 OPE 系统的可行性。ZPPO 将教师模型保留在提示中而不是策略梯度中,从而增强了小型学生模型的知识蒸馏。GD$^2$PO 通过过滤掉具有…
-
AI术语如Agents和RAG正在重塑职业生涯,需要新知识
本文讨论了AI Agents、自动化、工具调用、RAG和多Agent系统等AI术语日益普及的现象。文章认为,在快速的技术进步面前,理解这些概念对于保住职业生涯至关重要。作者暗示,通过博客等资源保持信息更新是驾驭不断变化的就业市场的关键。
-
Microsoft 详解用于构建 AI 应用的 Agent Framework
Microsoft 在 .NET 博客上发布了其“Agent Framework – Building Blocks for AI”系列的第三部分。本期深入探讨了 AI 代理的创建,重点介绍了其开发的关键组件。文章强调了多代理系统中工具调用和工作流管理等概念。