研究人员引入了一种新颖的自我训练架构,该架构仅依赖于环境生存能力进行学习,而不是传统的奖励函数或外部标准。该系统被称为“负空间学习”(NSL),仅传播那些在其环境中持续存在并能够进行未来交互的行为。该方法旨在通过避免奖励破解和语义漂移,即使在稀疏的外部反馈和有限的内存下,也能创建更强大、更具泛化能力的自主系统。 AI
影响 这种方法可以通过实现开放式的自我改进,无需人工策划的数据,从而带来更强大、更具泛化能力的自主系统。
排序理由 该集群包含一篇详细介绍新AI训练方法的 ist 研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →