PulseAugur
中
实时 07:31:59
实体 Actor-critic algorithm

Actor-critic algorithm

PulseAugur coverage of Actor-critic algorithm — every cluster mentioning Actor-critic algorithm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_273315 ·

    SEPAL框架增强LLM协作,提升问答能力

    研究人员开发了SEPAL,一个用于增强大型语言模型(LLM)在问答协作中的新框架。SEPAL采用三个独立的、经过私有训练的Actor-Critic团队进行推理、证据关联和验证,防止错误在团队之间传播。这种分离确保了反馈被限制在每个团队内部,只有最终答案通过多数投票进行合并。跨多个LLM骨干和基准的实验表明,与标准的Actor-Critic方法相比,SEPAL的准确率平均提高了1.81个百分点。

  2. TOOL · CL_218928 ·

    AI框架利用强化学习优化卫星调度

    研究人员开发了一个新颖的框架,用于优化异构敏捷地球观测卫星的调度。该框架结合了间接编码和基于解码器的评估,创建了一个统一的模型,该模型考虑了任务收益、节能和负载平衡。该系统利用强化学习来指导模因进化算法中的算子选择,从而提高复杂调度场景下的效率和稳定性。实验表明,这种强化学习辅助的方法在实现更高的整体加权效用方面优于现有的元启发式方法。

  3. TOOL · CL_141448 ·

    新方法优化资源受限情况下的基础模型微调

    研究人员开发了一种新颖的方法,用于在资源受限的设备上优化基础模型的持续微调。通过将问题表述为约束马尔可夫决策过程,他们的方法(一种 actor-critic 算法)学习了一个最优策略来决定何时微调模型。实验表明,该方法可以实现显著的性能提升,在准确率上超越标准微调方法 4% 以上,同时仅使用 25% 的微调步骤。

  4. TOOL · CL_151186 ·

    新方法优化了计算资源受限情况下的基础模型微调

    研究人员开发了一种基于强化学习的方法,利用 actor-critic 算法,来优化资源受限设备上基础模型的持续微调。该方法解决了在考虑计算成本和性能指标的情况下,决定何时使用传入数据微调模型的问题。该方法将问题构建为约束马尔可夫决策过程,并在准确性方面取得了显著改进,在使用仅 25% 的微调步骤的情况下,达到了全参数微调性能的 97%。

  5. TOOL · CL_96221 ·

    新AI框架优化复杂环境中的决策制定

    研究人员开发了一种在新方法,用于在大型马尔可夫决策过程中创建面向性能的环境抽象。该方法通过聚合状态并在这些状态内强制执行共享动作分布来专注于优化决策质量。该框架联合调整策略和树状环境抽象,并根据Q值差异精炼状态空间区域,以平衡性能与抽象的复杂性。实证结果表明,与现有的Actor-Critic基线相比,状态压缩显著,样本效率提高,重规划速度更快。

  6. TOOL · CL_26333 ·

    新的Actor-Critic算法优化动态风险管理

    研究人员开发了一种新的Actor-Critic算法,旨在优化随机策略中的动态风险管理。这种新颖的方法在策略更新中绕过了对转移扰动的需求,并利用无模型价值学习来处理动态分位数和条件在险价值。通过在表现出可验证的风险规避行为的领域进行实证测试,该算法在学习风险规避策略方面表现出卓越的性能。