PulseAugur
实时 18:40:25
实体 Safety Gymnasium

Safety Gymnasium

PulseAugur coverage of Safety Gymnasium — every cluster mentioning Safety Gymnasium across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_147432 ·

    新算法为自主系统合成形式化验证的控制策略

    研究人员开发了SMC-ES,一种将进化策略与统计模型检查相结合的新算法,可自动合成自主系统的控制策略。该方法对性能、安全性和鲁棒性提供形式化保证,确保遇到违规的概率低于指定阈值。SMC-ES在Gymnasium和Safety Gymnasium的连续控制任务上进行了评估,与领先的深度强化学习和Safe-DRL基线相比,表现具有竞争力,但计算成本有所增加。

  2. RESEARCH · CL_133612 ·

    新研究推动AI对齐和模仿学习中的样本效率

    研究人员开发了新的方法来改进人工智能代理与人类价值观的对齐。一种方法是反馈操纵正则化(FMR),它利用评估反馈作为模仿学习中的纠正信号来增强策略对齐,在适应性安全体育馆环境中显著减少了不对齐现象。另一项研究为离策略对抗模仿学习(AIL)算法提供了理论保证,表明重用近期策略的样本可以在不影响收敛的情况下提高样本效率,为更具数据效率的AIL提供了理论基础。

  3. RESEARCH · CL_91346 ·

    新的强化学习方法增强大型语言模型训练的稳定性和效率 · 跟踪 7 个来源

    研究人员开发了几种新方法来提高大型语言模型 (LLM) 中强化学习 (RL) 的稳定性和效率。STARE 通过根据惊奇度重新加权 token 级优势来解决策略熵崩溃问题,在推理基准测试中显示出更高的准确性。GrowthHacker 利用 LLM 代理自主优化离策略评估 (OPE) 代码,证明了改进 OPE 系统的可行性。ZPPO 将教师模型保留在提示中而不是策略梯度中,从而增强了小型学生模型的知识蒸馏。GD$^2$PO 通过过滤掉具有…

  4. TOOL · CL_16041 ·

    大型语言模型帮助在违规数据有限的情况下训练更安全的AI策略

    研究人员开发了PROCO,一个新颖的离线安全强化学习框架,专为违规数据有限的场景设计。这种基于模型的方法集成了来自大型语言模型的自然语言知识来构建保守的成本函数,即使没有观察到不安全样本也能进行风险估计。PROCO然后使用此成本函数和学习到的动态模型来生成合成的反事实不安全数据,从而促进策略学习,提高安全性。