tau^2-Bench
PulseAugur coverage of tau^2-Bench — every cluster mentioning tau^2-Bench across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的IAPO方法改进了多轮任务中LLM代理的信用分配
研究人员开发了一种名为影响感知策略优化(IAPO)的新方法,用于训练与用户和工具进行多轮交互的大型语言模型(LLM)代理。IAPO通过将代理动作和观察表示为影响依赖图来解决信用分配的挑战,从而能够根据信息和错误在任务中的流动情况更好地重新分配奖励。使用Qwen3-4B和Qwen3-8B模型在tau^2-Bench、UserBench和AgentChangeBench等基准上的实验表明,IAPO在不牺牲函数调用能力的情况下,优于现有的多…
-
新的FraudBench基准测试AI银行智能体以应对自适应欺诈
研究人员推出了FraudBench,这是一个旨在测试银行环境中对话式AI智能体安全性的新基准。与关注静态交易或通用有害用途的现有基准不同,FraudBench专门评估这些智能体在对话中处理操纵身份、授权和信任的自适应欺诈企图的能力。该基准利用了双重控制框架和一个拥有大型策略语料库的银行环境,包含150个精心设计的对抗性场景。对四个智能体的初步评估显示,攻击-安全率在49%到65%之间,其中“人头账户”欺诈和“第一方”欺诈是常见的弱点。
-
新方法将推理技能蒸馏到语言模型中,降低了代币成本
研究人员开发了一种方法,通过将知识蒸馏成紧凑的自然语言技能来提高语言模型中推理的效率。这种方法通过将现有轨迹中的共享过程编译成一种技能,然后将其注入到非推理模型的系统提示中,从而分摊了推理的成本,而推理通常需要 3-6 倍的输出代币。在四个代理基准测试中,该技术为 GPT-5.4-mini 恢复了 55%-100% 以上的推理差距,通常在显著减少代币使用量的同时,性能优于推理模式。
-
新框架生成合成数据以提升小型语言模型函数调用能力
研究人员开发了Data Turnstile,一个开源框架,旨在为函数调用任务生成高质量的合成训练数据,特别针对小型语言模型(SLMs)。该框架通过使用用户定义的API规范,并结合受约束的、分步生成以及验证和错误反馈循环,解决了现有数据稀缺和噪声的问题。实验表明,使用Data Turnstile数据微调的SLMs在函数调用基准测试中准确性显著提高,甚至在某些任务上超越了规模大得多的模型。
-
Living-Harness 系统通过自我进化提高 LLM 代理的可靠性 · 已追踪 2 个来源
研究人员开发了 Living-Harness,这是一个旨在提高大型语言模型 (LLM) 代理可靠性的新颖系统。与使用固定参数的静态工具不同,Living-Harness 根据过去的交互和评估信号动态更新其程序化知识。这种自我进化机制提取片段抽象和结构化更新证据,创建片段记忆和状态图来指导未来的行动。该系统在 tau^2-Bench 和 MultiWOZ-2.4 等基准测试中,平均 Pass@1 提高了 10 个百分点以上,表现出显著的性能提升。
-
Meta-TTL框架优化语言代理适应策略
研究人员开发了Meta-TTL,一个旨在优化语言代理适应策略以提高推理时性能的新颖框架。与使用固定策略的现有方法不同,Meta-TTL将适应策略发现视为一个双层优化问题。该方法使用进化搜索来评估策略在各种任务上的有效性,从而找到最优策略,并在同分布和异分布场景下的Jericho、WebArena-Lite和tau^2-Bench等基准测试中表现出优越的性能。
-
新的BREW框架使LLM代理能够从经验中学习
研究人员开发了BREW,这是一个新颖的框架,旨在使基于大型语言模型(LLM)的代理能够从过去的经验中学习。与每次会话都重新开始学习的当前代理不同,BREW将交互轨迹提炼成结构化的自然语言食谱知识库。该知识库捕获有关任务执行、适用性和潜在陷阱的基本信息。该系统利用扩展和收集蒙特卡洛树搜索算法来高效地构建和检索知识,并结合了事后重新标记,将不成功的尝试转化为学习机会。在OSWorld和tau^2-Bench等基准测试的评估中,与基线代理和…
-
新框架CurateEvo增强LLM Agent训练后数据策展 · 追踪2个来源
研究人员开发了CurateEvo,一个用于动态演进数据策展策略的新框架,以改进大型语言模型(LLM)Agent的训练后阶段。这种由失败驱动的方法通过分析失败的轨迹来迭代地优化策展方法,从而为微调和强化学习提供更有效和高效的数据准备。在ACEBench-Agent和tau^2-Bench等基准上的实验表明,CurateEvo的性能持续优于现有的策展技术,提高了Agent的性能并降低了开销。
-
新协议质疑多智能体LLM协调基准测试中的增益
一篇新论文提出了一种用于评估多智能体LLM协调的配对噪声基线协议。研究发现,先前研究中观察到的协调增益可能在误差范围内,这表明许多报告的基准测试差异不具有统计学意义。所提出的协议旨在为评估多智能体LLM系统中的协调提供一种更严谨的方法。
-
EnvFactory 通过合成环境自动化 LLM 工具使用训练
研究人员开发了 EnvFactory,这是一个旨在通过代理强化学习增强大型语言模型工具使用能力的自动化框架。该系统合成可执行工具环境,并从真实资源生成逼真的多轮训练轨迹。通过采用拓扑感知采样和精炼,EnvFactory 生成具有隐式意图的接地查询,克服了先前依赖昂贵 API 或简单合成数据的方法的局限性。该框架已显示出显著的性能提升,在 BFCLv3 等基准测试中将 Qwen3 系列模型提升了高达 15%,并增强了对话能力。
-
新指标量化大型语言模型代理的行为相似性和收敛性
一篇新论文介绍了两个指标:响应模式相似性(RPS)和动作图相似性(AGS),用于量化不同AI代理的工具使用行为有多相似。这些指标旨在区分与任务相关的基本操作和模型蒸馏产生的非必要行为模式。研究发现,同一提供商的模型比不同提供商的模型表现出更相似的工具使用习惯,并强调了Kimi-K2的高相似性得分。