Agentic Reinforcement Learning
PulseAugur coverage of Agentic Reinforcement Learning — every cluster mentioning Agentic Reinforcement Learning across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架通过结构化推理和记忆力推进 AI 视频理解
两篇新研究论文介绍了用于增强视频理解和推理能力的新颖框架。第一个,EventGraph 和 EventField,利用结构化时间表示在视频问答任务上实现高精度,优于基线方法。第二个,EventMemAgent,提出了一个具有分层记忆的活动代理框架,用于连续在线视频理解,集成了自适应工具使用和代理强化学习。
-
HARTS系统加速了混合注意力模型的智能强化学习
研究人员开发了HARTS,一个旨在提高混合注意力模型智能强化学习(RL)效率的新系统。HARTS通过采用前缀压缩和数据并行副本优化调度等技术,解决了在不规则展开树中重新计算共享前缀的挑战。该系统实现了激活重计算和状态恢复,在源自SWE-bench任务的智能RL工作负载上实现了高达4.8倍的显著加速。
-
AI框架SpecXMaster实现核磁共振谱图解析自动化
研究人员开发了SpecXMaster,一个利用Agentic强化学习的AI框架,用于自动化核磁共振(NMR)谱图数据的解析。该系统可以从1H和13C谱图中提取多重性信息,并将原始FID数据直接转换为化学结构,绕过了传统依赖人工的方法。SpecXMaster在公开基准测试中表现出色,并通过专家评估进行了优化,旨在对有机化学领域产生重大影响。
-
Hugging Face 澄清 AI 智能体术语,OpenEnv 获社区支持
Hugging Face 发布了一份术语表,以澄清围绕 AI 智能体的术语,包括 harness 和 scaffold 等概念。此外,开源社区正在支持 OpenEnv,这是一个专为智能体强化学习设计的框架。
-
OmniAgent 使用主动感知进行高效视频理解 · 已追踪 2 个来源
研究人员推出 OmniAgent,这是一种新颖的全模态智能体,用于视频理解,它利用基于部分可观察马尔可夫决策过程 (POMDP) 的迭代式观察-思考-行动 (Observation-Thought-Action) 循环。这种方法允许智能体选择性地将视听线索提炼成文本记忆,从而将推理复杂性与原始视频时长解耦,提高计算效率。该论文详细介绍了两种关键的训练方法:用于引导主动感知的智能体监督微调 (Agentic Supervised Fin…