实体
Rema
Rema
PulseAugur coverage of Rema — every cluster mentioning Rema across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新HiPO方法通过分割训练反馈来增强LLM推理能力
研究人员推出了一种名为HiPO(Hierarchical Preference Optimization,分层偏好优化)的新方法,旨在提高大型语言模型(LLM)的推理能力。与将整个响应视为单一单元的标准直接偏好优化(DPO)不同,HiPO将响应分割成不同的部分,如推理步骤和答案。这使得反馈更加细粒化,训练更具针对性,从而增强了模型处理复杂、多步推理任务的能力。在数学基准测试上的评估表明,使用HiPO进行微调的LLM在性能和逻辑一致性方…
-
AI代理通过元认知和提示优化获得智能
近期研究探索了超越简单重试循环以完成复杂任务的高级代理架构。诸如“Supervising Ralph Wiggum”之类的研究表明,将元认知批评分离到一个独立的代理中,与自监控或基本重试机制相比,在设计任务上的性能得到了显著提高。ReMA等工作也呼应了这一趋势,它使用元思考器和执行器对来改进数学推理。这些论文的根本主题是分解代理功能的好处,无论是为了元认知、规划还是提示优化,这表明当前的LLM可能已经拥有更复杂的自我改进的基础元素。