作者测试了包括 Qwen 4B、Mistral 24B、Mistral 30B 和一个 1B 模型在内的四种不同的语言模型,试图改进一个自改进 AI 代理的提示。尽管进行了数千次 LLM 调用的大量测试,但没有一个模型能够生成可推广的编辑。作者得出结论,问题不在于模型本身的能力,而在于代理所采用的搜索策略,因为所有模型都收敛于相似的、无效的编辑。 AI
影响 强调了当前 AI 代理搜索策略的局限性,表明需要超越简单地增加模型规模的创新。
排序理由 该条目是一篇关于技术挑战及其解决方案的个人博客文章,而不是正式的研究论文或产品公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →