BFCL v3
PulseAugur coverage of BFCL v3 — every cluster mentioning BFCL v3 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的IACM-RL框架增强了AI在动态意图变化下的工具调用能力
研究人员开发了一个名为IACM-RL的新框架,以提高AI系统执行复杂工具调用的可靠性,特别是在用户意图动态变化的情况下。该系统解决了在指令波动等现实场景中出现的无限API循环和过时上下文错误等问题。IACM-RL利用基于信念状态的自生成上下文管理器来跟踪不断变化的目標并隔离过时的参数,通过分层意图驱动的奖励和辅助损失来优化其策略。在DynamicIntent、BFCL-V3和$\mathrm{\tau}^2$-Bench等基准测试上的…
-
新的HINT-SD框架提高了LLM智能体训练效率
研究人员开发了HINT-SD,一个旨在提高长时序大型语言模型(LLM)智能体训练效率和效果的新框架。该方法侧重于识别和纠正轨迹中导致任务失败的特定动作,而不是对每一个回合都应用反馈。通过利用后视分析来定位这些关键决策点,HINT-SD显著减少了训练所需的时间和计算资源,在BFCL v3和AppWorld等基准测试中的改进证明了这一点。
-
Z.AI 的 GLM 5.1 模型在长时序代理任务中领先,超越竞争对手
Z.AI 发布了其 GLM 5.1 模型,这是一个开源选项,专为长时序代理任务设计,能够自主运行长达 8 小时。据报道,该模型在 SWE-Bench Pro 基准测试中优于 GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro。该公司还提供 GLM 4.5 Air 用于更快、成本更低的日常使用,以及 GLM 5 Turbo 用于中等级别的代理执行,所有这些都可以通过 MCP Agent Studio 访问,…