实体
SRA-Bench
SRA-Bench
PulseAugur coverage of SRA-Bench — every cluster mentioning SRA-Bench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的“能力页面”方法提高了大型语言模型技能检索的准确性
研究人员开发了一种名为能力页面(Capability Pages)的新方法,以改进大型语言模型代理检索可重用技能的方式。该方法将技能的能力形式化为其可执行区域,即它可以解决的查询集,并将技能文档视为该区域的观察。能力页面包括一个正触发器、一个负边界和一个判别体,它们是通过离线比较相邻技能生成的。在实施时,这些页面通过帮助路由器拒绝混淆的替代方案,从而提高了候选召回率并改善了端到端任务的成功率。
-
新的SkillSight框架提高了LLM代理的技能检索准确性
研究人员开发了SkillSight,一个旨在提高大型语言模型代理技能检索准确性和效率的新颖框架。SkillSight解决了技能库中共享描述模式可能掩盖任务相关信号的问题。通过校准语义和词汇空间,该框架减少了由常见描述元素引起的相似性,并降低了背景令牌的权重。实验表明,SkillSight显著提高了检索指标,优于现有方法并实现了显著的加速。
-
新的技能检索增强范式提升了代理式AI的性能
研究人员推出了一种名为技能检索增强(SRA)的新方法,用于增强代理式AI系统。SRA允许代理从大型外部语料库中动态检索和应用技能,克服了在上下文窗口中枚举技能的局限性。为了评估这种方法,该论文提出了SRA-Bench,这是一个包含5,400个测试实例和26,262个技能的技能语料库的基准。实验表明,SRA显著提高了代理性能,尽管基础模型在确定何时加载技能的能力方面仍存在差距。