研究人员推出了ASPIRE,这是一个新的基准测试,旨在测试大型语言模型(LLM)在给定模糊的自然语言目标而非明确任务时的自我进化能力。与依赖人类定义的目标的现有方法不同,ASPIRE要求代理解释目标、识别学习需求、选择数据和更新方法,并创建自己的评估信号。实验表明,虽然代理可以进行训练和进行模型编辑循环,但模型权重的稳定改进仍然具有挑战性,即使是最好的进化代理也未能超越Qwen-Agent等工程化参考。 AI
影响 该基准测试可能会推动对更自主、更适应性强的AI系统的研究,这些系统能够从模糊的指令中学习。
排序理由 该集群包含一篇介绍LLM自我进化新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- qwen-agent
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →