PulseAugur
中
实时 16:12:03
实体 DeepSeekMath

DeepSeekMath

PulseAugur coverage of DeepSeekMath — every cluster mentioning DeepSeekMath across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_261186 ·

    GRPO 算法变体阐明其在强化学习微调中的作用

    Shao 及其同事推出的 GRPO 算法是近端策略优化 (PPO) 的一种变体,它通过移除计算成本高昂的评论员网络来修改训练过程。GRPO 使用奖励模型为给定问题的多个采样输��打分,并根据组平均值计算优势,而不是使用评论员。这种方法以增加生成时间为代价,换取了内存和计算负担的减少。值得注意的是,GRPO 并不消除奖励模型本身,也不放弃 KL 正则化,而是将其重新定位在损失函数中。

  2. COMMENTARY · CL_230524 ·

    LLM 微调方法:SFT、LoRA、QLoRA、RFT 和蒸馏法详解

    本文概述了微调大型语言模型的各种方法,重点关注实际应用和工具选择。监督微调(SFT)被介绍为起点,需要有标签的输入-输出对。LoRA 和 QLoRA 被讨论为高效的替代方案,它们训练适配器权重而不是整个模型,其中 Unsloth 被指出可以加速这些过程。强化微调(RFT),特别是使用 GRPO 及其变体(如 DAPO++ 和 Dr.GRPO),推荐用于输出质量的判断比演示更容易的任务,例如代理行为。蒸馏法也被涵盖,作为一种将知识从大型…

  3. TOOL · CL_184016 ·

    Karpathy 的 nanochat 使用简化的 GRPO 进行 RL 循环

    Andrej Karpathy 的 nanochat 项目包含一个简化的强化学习循环,标记为 GRPO,它偏离了标准的 GRPO 算法。该循环使用基本的策略梯度方法,本质上是带有均值基线的 REINFORCE,以提高模型在具有机器可检查奖励的任务(如 GSM8K)上的性能。这种简化的方法省略了完整 GRPO 配方中存在的安全护栏,而是侧重于根据批次的平均分数调整模型的输出,而不是依赖单独的评估器或复杂的奖励建模。

  4. TOOL · CL_51393 ·

    新的强化学习策略提升高频交易表现

    研究人员开发了用于限价订单簿高频交易的新型强化学习策略。他们的方法利用订单流信号作为状态表示,并采用策略梯度方法,特别是群组感知近端策略优化(PPO)的变体,如GRPO和GSPO。在AMZN、AAPL和GOOG等金融资产上的回测表明,这些新策略在净利润、盈利能力和回撤方面优于Q-Learning基线。

  5. RESEARCH · CL_29077 ·

    开源 AntAngelMed 模型以 103B 参数提供高效医疗 AI

    研究人员推出 AntAngelMed,一个拥有 1030 亿参数的开源医疗语言模型。它采用了专家混合(MoE)架构,每次查询仅激活 61 亿参数,从而提高了效率。这种设计使其在 H20 硬件上能够以超过每秒 200 个 token 的速度,媲美 400 亿参数密集模型的性能。该模型支持 128K 上下文长度,并经历了包括在医学语料库上预训练、监督微调和强化学习在内的三阶段训练过程。