PulseAugur
实时 10:10:27
实体 BFCL

BFCL

PulseAugur coverage of BFCL — every cluster mentioning BFCL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_155487 ·

    新方法Soft Clamp应对AI代理过度调用工具的问题

    研究人员在用于使用工具的AI代理的多教师在线策略蒸馏中发现了一种故障模式。该方法虽然提高了工具调用召回率,但可能导致代理不恰当地过度调用工具。该论文介绍了一种名为“Soft Clamp”的新校准技术,该技术可以动态调整token级别的散度,以减轻这种过度调用行为,同时不牺牲准确性。这种方法有助于确保代理正确地平衡工具使用与直接响应。

  2. RESEARCH · CL_133168 ·

    新的Soft Clamp方法解决了代理语言模型的过度调用问题

    研究人员在代理语言模型的多教师同策略蒸馏中发现了一个“行为杠杆失衡”问题。这种失衡会导致模型过度调用工具,即使在直接回答更合适的情况下也是如此,而这个问题无法通过聚合损失指标来检测。为了解决这个问题,提出了一种名为Soft Clamp的新方法,该方法对每令牌发散进行校准以减轻极端信号。实验表明,Soft Clamp显著减少了过度调用,并提高了APIGen-MT等基准测试的决策准确性。

  3. TOOL · CL_126515 ·

    量化对 LLM 工具调用的影响在低端硬件上进行了测量

    一项新的基准测试 QuantCall 被开发出来,用于评估量化对小型语言模型工具调用能力的影响。该基准测试在 4GB 笔记本 GPU 上运行,发现模型家族比模型大小更能预测量化下的性能。具体来说,Qwen3-0.6B 在 Q4 量化下仍能很好地保持模式有效性,而 Llama-3.2-1B 即使在更高量化水平下也表现出脆弱的模式有效性。研究还表明,更难的多工具任务会加剧量化引起的性能下降,并且受限解码或不同的服务后端并未显著改善结果。

  4. TOOL · CL_79757 ·

    新方法使LLM规划与工具执行对齐

    研究人员推出了一种名为能力对齐分层学习(CAHL)的新方法,用于改进大型语言模型(LLM)使用外部工具的方式。CAHL通过联合优化高层规划策略和底层工具执行策略,解决了两者之间常见的对齐问题。在API-Bank、BFCL和Bamboogle等各种工具使用基准上的实验表明,CAHL在提升LLM性能方面是有效的。

  5. TOOL · CL_58640 ·

    ParaTool框架通过参数化工具来增强LLM的工具使用能力

    研究人员推出了一种名为ParaTool的新型框架,旨在增强大型语言模型(LLM)利用外部工具的能力。与将工具文档嵌入模型上下文的传统方法不同,ParaTool将每个工具投影到一组不同的参数中。这种方法旨在降低推理开销,并最大限度地减少与长上下文相关的幻觉风险。该框架包括参数化工具预训练、通过门控网络进行软工具选择以及工具参数的联合微调。在Stable ToolBench和BFCL等基准测试上的实验表明,ParaTool在降低计算复杂性…

  6. TOOL · CL_35049 ·

    Apple 的强化代理在执行前审查工具调用

    Apple 研究人员开发了一种“强化代理”,可在执行前主动验证工具调用,旨在预防错误而非事后纠正。该方法在 BFCL 不相关性和 τ²-Bench 等基准测试中取得了显著改进,推理模型审查员实现了 3:1 的有益/有害比率。该系统在 GEPA 提示优化方面也取得了适度提升,而无需重新训练模型。