end-to-end reinforcement learning
PulseAugur coverage of end-to-end reinforcement learning — every cluster mentioning end-to-end reinforcement learning across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
引入新的随机自回归学习PAC学习模型
研究人员引入了一个新的二元随机自回归学习PAC学习模型,该模型受到大型语言模型(LLMs)迭代令牌生成过程的启发。该模型泛化了确定性自回归学习,并考虑了三种监督形式:基础单步样本、揭示完整轨迹的思维链(CoT)样本,以及仅揭示最终令牌的端到端(e2e)样本。该研究分析了在平方损失误差下学习所需的最小样本数量,并证明随机自回归学习与其确定性对应物存在显著差异,学习任务之间存在复杂的依赖关系。
-
新方法为建设性多任务学习聚类任务
研究人员开发了一种语义感知任务聚类方法,以改进协作式多任务学习(CMT-SemCom)。该方法在初始训练后对语义对齐的任务进行聚类,然后在这些聚类内进行端到端联合训练。该方法旨在减轻破坏性协作和负迁移,在未聚类多任务和单独训练基线方面显示出准确性提升。
-
新研究精确刻画了强化学习中的奖励投毒漏洞
本文对强化学习智能体何时易受奖励投毒攻击进行了精确刻画。研究聚焦于线性马尔可夫决策过程(MDP),并为对手在有限预算内成功操纵智能体策略建立了必要和充分条件。该框架通过将环境近似为线性MDP,可以扩展到深度强化学习,证明了其在识别和利用可攻击智能体方面的理论和实践意义。
-
婴儿运动噪声增强深度强化学习探索
研究人员开发了一种新颖的深度强化学习探索策略,该策略受到婴儿自发运动的启发。该方法引入了模仿婴儿运动控制发展模式的时间相关噪声,与标准的白噪声探索相比,在各种强化学习环境中显示出更高的学习效率。研究结果表明,来自人类运动发展的见解可以为设计更有效的人工智能代理提供信息。
-
新调查详细介绍了端到端多说话人自动语音识别的进展
一篇新近发表在arXiv上的调查论文详细介绍了面向单声道音频的端到端(E2E)多说话人自动语音识别(ASR)的进展。该论文系统地回顾了E2E神经方法,按SIMO和SISO等架构范式进行分类,并讨论了在处理长篇语音和说话人归属方面的改进。它还评估了标准基准上的当前方法,并概述了未来更鲁棒的ASR系统的研究方向。
-
GIFT: Global stabilisation via Intrinsic Fine Tuning
研究人员推出了一种名为全局内在微调稳定(GIFT)的新训练框架,旨在提高深度强化学习(RL)策略的稳定性。当前的深度 RL 策略常常表现出混乱的状态动力学,使其对初始条件敏感并限制了其实际应用。GIFT 通过引入自定义奖励函数,直接优化现有 RL 策略的全局稳定性,旨在在不牺牲任务性能的情况下提高可靠性。