PulseAugur
实时 15:04:17
实体 BFCL v4

BFCL v4

PulseAugur coverage of BFCL v4 — every cluster mentioning BFCL v4 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_188515 ·

    LLM JSON 优化在不同模型上效果不一

    一项涉及 LLM JSON 字段表示法变更的优化在 Qwen2.5-7B 模型上显示出有希望的结果,提高了在 GSM8K 基准测试上的正确率。然而,这项优化未能转化为 Llama 3.2 3B 模型,降低了其在同一基准测试和可执行工具调用任务上的正确率。研究结果表明,虽然这种表示法的改变可能对某个模型有益,但它们并非普遍适用的优化器,并且代表了对模型的语义干预。

  2. TOOL · CL_187375 ·

    研究发现:程序化工具调用优于LLM的JSON调用

    一篇新论文评估了大语言模型的程序化工具调用(PTC)与传统JSON工具调用的对比。研究发现,PTC将工具暴露为模型可调用的类型化Python存根,在BFCL v4基准测试中,对于大多数测试模型,其性能与JSON工具调用相当或更优。值得注意的是,GPT-5.6系列在使用PTC时比JSON基线提高了10.6%,并且在基线性能下降的上下文轮换条件下,PTC保持了稳定性。

  3. RESEARCH · CL_139237 ·

    Mach-Mind-4-Flash:35B MoE 模型性能媲美 100B+ 模型

    研究人员推出了 Mach-Mind-4-Flash,这是一个拥有 350 亿参数的专家混合(MoE)模型,但仅激活 30 亿参数。通过训练后优化,该模型实现了与 1000 亿参数模型相当或更优的性能。该系统采用三阶段流程,包括统一的 RL/OPD 训练基础设施、通过多教师在线策略蒸馏融合的领域特定 RL 专家,以及用于压缩推理链的混合中位数长度策略优化。

  4. RESEARCH · CL_128930 ·

    新框架CurateEvo增强LLM Agent训练后数据策展 · 追踪2个来源

    研究人员开发了CurateEvo,一个用于动态演进数据策展策略的新框架,以改进大型语言模型(LLM)Agent的训练后阶段。这种由失败驱动的方法通过分析失败的轨迹来迭代地优化策展方法,从而为微调和强化学习提供更有效和高效的数据准备。在ACEBench-Agent和tau^2-Bench等基准上的实验表明,CurateEvo的性能持续优于现有的策展技术,提高了Agent的性能并降低了开销。

  5. FRONTIER RELEASE · CL_108496 ·

    阿里巴巴Qwen发布AgentWorld语言模型用于环境模拟

    阿里巴巴的Qwen团队推出了Qwen-AgentWorld,一个旨在模拟各种代理环境的新型语言世界模型。该模型侧重于训练大型语言模型理解和预测环境,而不仅仅是在其中行动。研究探索了两个主要途径:构建一个用于环境模拟的基础模型,以及研究世界建模如何增强代理训练,表明使用世界模型训练的代理可以优于在真实环境中训练的代理,并且预测性知识能有效地迁移到代理任务中。