BFCL
PulseAugur coverage of BFCL — every cluster mentioning BFCL across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的基准和数据合成方法提高了 LLM 多步工具调用能力
研究人员推出了 KOPA-Bench,这是一个旨在评估开源 LLM 代理在韩国公共 API 上执行多步工具调用性能的新基准。为了解决这些模型在当前任务中的表现不佳的问题,他们开发了 EDGE,一种数据合成方法,该方法可以动态地针对实时 API 对工具调用序列进行图谱绘制和验证。使用 EDGE 进行微调的模型表现出显著的改进,其中一个 9B 参数的模型在 KOPA-Bench 和 BFCL 基准上的性能与一个更大、未经微调的模型相当。
-
AI研究在推理、优化和移动基准测试方面取得进展
研究人员正在探索用于改进AI推理和统计分析的高级技术,特别是在资源受限的环境中。一篇论文介绍了IMABO,一个在线超参数优化(OHPO)框架,可在实时推理过程中调整配置,并以LLM代理进行了演示。另一项研究侧重于由预测驱动的条件推理,利用机器学习预测器来提高低数据场景下的统计准确性。第三篇论文提出了一种合成增强推理方法,学习一个尺寸-权重前沿,以确保在使用合成数据时获得可靠的结果。此外,一项基准测试工作评估了手机上的小型AI模型,同时…
-
AI智能体基准测试噪声审计,SIGMA框架应对多智能体鲁棒性
两篇新研究论文探讨了AI智能体性能和鲁棒性方面的挑战。第一篇论文介绍了SIGMA,一个旨在通过考虑观测中的结构化噪声效应来改进多智能体强化学习的层级框架,并在《星际争霸II》中展示了改进的鲁棒性。第二篇论文审计了智能体基准测试中的测量变异性,特别检查了工具调用端点,发现提示扰动比重新运行引入了更显著的噪声,影响了准确性和故障模式。
-
Nanbeige4.2-3B 模型已修复 Apple Silicon 部署问题
一篇新论文详细介绍了在 Apple Silicon 上部署 Nanbeige4.2-3B 模型(一个拥有 30 亿参数、采用 Looped Transformer 架构的 agentic 模型)所面临的挑战及解决方案。研究人员发现了五个阻止该模型在 Hugging Face Transformers 上运行的关键 bug,包括 RoPE 缓冲区和 API 调用问题。此外,该模型的层重用策略导致了显著的内存开销,限制了其有效上下文宽度。…
-
新研究探索用于自动提示优化的模块化和递归方法
两篇新研究论文介绍了优化大型语言模型提示的新方法。第一篇SAPO将提示分解为角色、上下文和任务等部分,从而进行有针对性的改进,以提高在各种基准测试中的性能。第二篇RLMOpt利用递归语言模型来驱动优化过程本身,从而在多个任务和基准测试中实现更高效、更有效的提示生成,其性能通常优于GEPA等现有方法。
-
新框架生成合成数据以提升小型语言模型函数调用能力
研究人员开发了Data Turnstile,一个开源框架,旨在为函数调用任务生成高质量的合成训练数据,特别针对小型语言模型(SLMs)。该框架通过使用用户定义的API规范,并结合受约束的、分步生成以及验证和错误反馈循环,解决了现有数据稀缺和噪声的问题。实验表明,使用Data Turnstile数据微调的SLMs在函数调用基准测试中准确性显著提高,甚至在某些任务上超越了规模大得多的模型。
-
新方法Soft Clamp应对AI代理过度调用工具的问题
研究人员在用于使用工具的AI代理的多教师在线策略蒸馏中发现了一种故障模式。该方法虽然提高了工具调用召回率,但可能导致代理不恰当地过度调用工具。该论文介绍了一种名为“Soft Clamp”的新校准技术,该技术可以动态调整token级别的散度,以减轻这种过度调用行为,同时不牺牲准确性。这种方法有助于确保代理正确地平衡工具使用与直接响应。
-
新的Soft Clamp方法解决了代理语言模型的过度调用问题
研究人员在代理语言模型的多教师同策略蒸馏中发现了一个“行为杠杆失衡”问题。这种失衡会导致模型过度调用工具,即使在直接回答更合适的情况下也是如此,而这个问题无法通过聚合损失指标来检测。为了解决这个问题,提出了一种名为Soft Clamp的新方法,该方法对每令牌发散进行校准以减轻极端信号。实验表明,Soft Clamp显著减少了过度调用,并提高了APIGen-MT等基准测试的决策准确性。
-
量化对 LLM 工具调用的影响在低端硬件上进行了测量
一项新的基准测试 QuantCall 被开发出来,用于评估量化对小型语言模型工具调用能力的影响。该基准测试在 4GB 笔记本 GPU 上运行,发现模型家族比模型大小更能预测量化下的性能。具体来说,Qwen3-0.6B 在 Q4 量化下仍能很好地保持模式有效性,而 Llama-3.2-1B 即使在更高量化水平下也表现出脆弱的模式有效性。研究还表明,更难的多工具任务会加剧量化引起的性能下降,并且受限解码或不同的服务后端并未显著改善结果。
-
新方法使LLM规划与工具执行对齐
研究人员推出了一种名为能力对齐分层学习(CAHL)的新方法,用于改进大型语言模型(LLM)使用外部工具的方式。CAHL通过联合优化高层规划策略和底层工具执行策略,解决了两者之间常见的对齐问题。在API-Bank、BFCL和Bamboogle等各种工具使用基准上的实验表明,CAHL在提升LLM性能方面是有效的。
-
ParaTool框架通过参数化工具来增强LLM的工具使用能力
研究人员推出了一种名为ParaTool的新型框架,旨在增强大型语言模型(LLM)利用外部工具的能力。与将工具文档嵌入模型上下文的传统方法不同,ParaTool将每个工具投影到一组不同的参数中。这种方法旨在降低推理开销,并最大限度地减少与长上下文相关的幻觉风险。该框架包括参数化工具预训练、通过门控网络进行软工具选择以及工具参数的联合微调。在Stable ToolBench和BFCL等基准测试上的实验表明,ParaTool在降低计算复杂性…
-
Apple 的强化代理在执行前审查工具调用
Apple 研究人员开发了一种“强化代理”,可在执行前主动验证工具调用,旨在预防错误而非事后纠正。该方法在 BFCL 不相关性和 τ²-Bench 等基准测试中取得了显著改进,推理模型审查员实现了 3:1 的有益/有害比率。该系统在 GEPA 提示优化方面也取得了适度提升,而无需重新训练模型。