研究人员开发了 RLTL;DR,一种新颖的 AI 自我改进方法,允许模型在失败尝试后生成并内化自己的反馈。该方法在具有挑战性的工具调用和编码任务上显示出显著的改进,即使在评估期间没有反馈的情况下,也能达到 14-31% 的 Pass@1。此外,研究正在探索 LLM 的递归社交改进,其中代理之间相互学习,但目前的 LLM 代理在效率和有效性方面难以超越独立学习者。 AI
影响 新的自我改进技术可以加速 AI 的发展,而对社交学习的研究可能会为未来的多代理 AI 系统提供信息。
排序理由 该集群包含多篇详细介绍 AI 自我改进和社交学习新方法的论文。
在 Apple Machine Learning Research 阅读 →
- Apple Inc.
- LLM agents
- Michael Kirchhof
- Qwen 3.5 9B
- recursive social improvement
- RLTL;DR
- SFTL;DR
- solo learners
- SWE-bench Verified
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →