Meta 研究人员发布了两篇论文,详细介绍了 AI 扩展定律和智能体(agent)利用开发方面的进展。第一篇论文提出了一种将模型容量和训练数据相结合的“扩展定律”(Scaling law),提高了损失预测的准确性,并减少了规划预训练预算的计算需求。第二篇论文提出了 EvoHarness-RL,一种使智能体(agent)能够离线学习利用策略(harness policies)的方法,从而能够执行更鲁棒的长期任务,并在 ALFWorld 基准测试中与 Qwen3_8B 模型一起展现出强大的性能。 AI
影响 这些在扩展定律和智能体(agent)利用开发方面的进展可能带来更高效的 AI 训练和更强大的长期任务执行智能体(agent)。
排序理由 该集群包含两篇学术论文,详细介绍了 Meta 的新研究发现和方法论。
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →