一篇新的arXiv论文探讨了自改进大型语言模型(LLM)中“赢者诅咒”现象。该研究使用Qwen模型重写自己的指令,发现初始指令之外的大多数提议的更改都是有害的。研究强调了当LLM在小型、重复使用的数据集上评估自身改进时,选择噪声和锁定问题会导致报告的收益相对于实际的保留准确率膨胀。 AI
影响 强调了LLM自改进中潜在的陷阱,表明需要更鲁棒的评估方法来避免性能下降。
排序理由 学术论文,详细介绍了LLM自改进中的特定现象。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →