实体
ACEBench-Agent
ACEBench-Agent
PulseAugur coverage of ACEBench-Agent — every cluster mentioning ACEBench-Agent across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
SPADE框架使用LLM设计自适应训练环境以实现自我改进
研究人员开发了SPADE,一个新颖的自我博弈强化学习框架,其中单个大型语言模型既充当环境设计者又充当推理代理。环境设计者创建具有OpenAI Gym风格界面的自适应、可执行的训练环境,而推理代理则学习在这些环境中执行任务。这种方法旨在通过动态调整训练目标的难度以匹配代理不断发展的能力来实现持续的自我改进,并在各种基准测试中显示出显著的性能提升。
-
新框架CurateEvo增强LLM Agent训练后数据策展 · 追踪2个来源
研究人员开发了CurateEvo,一个用于动态演进数据策展策略的新框架,以改进大型语言模型(LLM)Agent的训练后阶段。这种由失败驱动的方法通过分析失败的轨迹来迭代地优化策展方法,从而为微调和强化学习提供更有效和高效的数据准备。在ACEBench-Agent和tau^2-Bench等基准上的实验表明,CurateEvo的性能持续优于现有的策展技术,提高了Agent的性能并降低了开销。