DeepSeekMath
PulseAugur coverage of DeepSeekMath — every cluster mentioning DeepSeekMath across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
GRPO 算法变体阐明其在强化学习微调中的作用
Shao 及其同事推出的 GRPO 算法是近端策略优化 (PPO) 的一种变体,它通过移除计算成本高昂的评论员网络来修改训练过程。GRPO 使用奖励模型为给定问题的多个采样输��打分,并根据组平均值计算优势,而不是使用评论员。这种方法以增加生成时间为代价,换取了内存和计算负担的减少。值得注意的是,GRPO 并不消除奖励模型本身,也不放弃 KL 正则化,而是将其重新定位在损失函数中。
-
LLM 微调方法:SFT、LoRA、QLoRA、RFT 和蒸馏法详解
本文概述了微调大型语言模型的各种方法,重点关注实际应用和工具选择。监督微调(SFT)被介绍为起点,需要有标签的输入-输出对。LoRA 和 QLoRA 被讨论为高效的替代方案,它们训练适配器权重而不是整个模型,其中 Unsloth 被指出可以加速这些过程。强化微调(RFT),特别是使用 GRPO 及其变体(如 DAPO++ 和 Dr.GRPO),推荐用于输出质量的判断比演示更容易的任务,例如代理行为。蒸馏法也被涵盖,作为一种将知识从大型…
-
Karpathy 的 nanochat 使用简化的 GRPO 进行 RL 循环
Andrej Karpathy 的 nanochat 项目包含一个简化的强化学习循环,标记为 GRPO,它偏离了标准的 GRPO 算法。该循环使用基本的策略梯度方法,本质上是带有均值基线的 REINFORCE,以提高模型在具有机器可检查奖励的任务(如 GSM8K)上的性能。这种简化的方法省略了完整 GRPO 配方中存在的安全护栏,而是侧重于根据批次的平均分数调整模型的输出,而不是依赖单独的评估器或复杂的奖励建模。
-
新的强化学习策略提升高频交易表现
研究人员开发了用于限价订单簿高频交易的新型强化学习策略。他们的方法利用订单流信号作为状态表示,并采用策略梯度方法,特别是群组感知近端策略优化(PPO)的变体,如GRPO和GSPO。在AMZN、AAPL和GOOG等金融资产上的回测表明,这些新策略在净利润、盈利能力和回撤方面优于Q-Learning基线。
-
开源 AntAngelMed 模型以 103B 参数提供高效医疗 AI
研究人员推出 AntAngelMed,一个拥有 1030 亿参数的开源医疗语言模型。它采用了专家混合(MoE)架构,每次查询仅激活 61 亿参数,从而提高了效率。这种设计使其在 H20 硬件上能够以超过每秒 200 个 token 的速度,媲美 400 亿参数密集模型的性能。该模型支持 128K 上下文长度,并经历了包括在医学语料库上预训练、监督微调和强化学习在内的三阶段训练过程。