SearchQA
PulseAugur coverage of SearchQA — every cluster mentioning SearchQA across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
SkillAA framework enhances LLM external skill integration with attribution-guided updates
A new framework called SkillAA has been developed to improve how large language models interact with external skills. This system uses a skill graph to guide the selection, repair, and validation of these skills, contra…
-
新的 WHALE 方法联合优化 AI 代理权重和 Harness 代码
研究人员开发了一种名为 WHALE(Weight-Harness Alternating LEarning)的新方法,通过同时更新模型权重和管理上下文与控制流的 Harness 代码来联合优化 AI 代理性能。该方法在更新模型和搜索改进的 Harness 之间交替进行,解决了单独优化一个组件会限制另一个组件的瓶颈问题。使用 Qwen3.5-2B/4B 代理在 SearchQA、数学推理和国际象棋谜题等任务上的实验表明,WHALE 的性…
-
新的AUSO方法优化AI代理技能,从指导到利用
研究人员引入了AUSO(动作级统一技能优化),一种新颖的AI代理训练方法,它将技能从外部指导逐步整合到内部决策知识中。该方法旨在改进代理在其策略演变过程中学习和利用技能的方式。AUSO在训练早期联合学习教师指导和环境结果,然后转向基于结果的优化,最后根据有技能条件和无技能条件的上下文评估动作,以完善技能利用。在ALFWorld、WebShop和SearchQA基准上的实验表明,AUSO增强了代理的性能和泛化能力。
-
新研究解决了长时序任务中LLM智能体的信用分配问题 · 已追踪2个来源
两篇新研究论文探讨了改进大型语言模型(LLM)智能体信用分配的方法,特别是在成功信号稀疏的长时序任务中。第一篇论文《无真实标签的信用分配》(Credit Without Ground Truth)在ALFWorld中根据因果真实标签审计了现有的信用信号,发现它们表现不佳,常常反映模型流畅性而非实际贡献。第二篇论文《TRCA:逐转换评分信用分配》(TRCA: Transition-wise Rubric Credit Assignmen…
-
新的CAPS框架弥合了视觉-文本压缩中的智能体策略差距
研究人员开发了一个名为CAPS(跨模态智能体策略自蒸馏)的新框架,以解决多步语言模型智能体在视觉-文本压缩中的能力差距。当交互历史被转换为图像时,这种差距会出现,从而影响智能体性能。CAPS采用两阶段自蒸馏过程,使用更强的文本历史策略作为监督者来训练视觉历史智能体策略。该方法在SearchQA和ALFWorld等任务上显著提高了性能,同时大幅降低了内存-上下文成本。
-
SoftSkill 方法将 LLM 技能压缩为紧凑的潜在控制
研究人员开发了 SoftSkill,一种通过将技能压缩为紧凑、连续的上下文对象来使大型语言模型适应特定任务的新方法。该方法使用可训练的“软 delta”来精炼冻结的主干模型,其性能显著优于传统的基于 Markdown 的技能文件。SoftSkill 在 SearchQA、LiveMath 和 DocVQA 等基准测试中显示出显著的准确性提高,同时大大减少了技能编码所需的 token 数量。
-
香港中文大学团队推出SLIM,实现大语言模型智能体的动态技能管理
香港中文大学的研究人员开发了SLIM,一个用于管理大语言模型智能体所用技能生命周期的新框架。SLIM在训练过程中动态评估每个外部技能的贡献,保留有用的技能,淘汰影响减弱的技能,并扩展技能集以应对新的失败场景。这种方法旨在通过超越简单地累积或丢弃技能来优化智能体的性能,使其能够更有效地适应复杂任务。