PulseAugur
实时 16:08:49
实体 DeepSeekMath

DeepSeekMath

PulseAugur coverage of DeepSeekMath — every cluster mentioning DeepSeekMath across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_184016 ·

    Karpathy 的 nanochat 使用简化的 GRPO 进行 RL 循环

    Andrej Karpathy 的 nanochat 项目包含一个简化的强化学习循环,标记为 GRPO,它偏离了标准的 GRPO 算法。该循环使用基本的策略梯度方法,本质上是带有均值基线的 REINFORCE,以提高模型在具有机器可检查奖励的任务(如 GSM8K)上的性能。这种简化的方法省略了完整 GRPO 配方中存在的安全护栏,而是侧重于根据批次的平均分数调整模型的输出,而不是依赖单独的评估器或复杂的奖励建模。

  2. TOOL · CL_51393 ·

    新的强化学习策略提升高频交易表现

    研究人员开发了用于限价订单簿高频交易的新型强化学习策略。他们的方法利用订单流信号作为状态表示,并采用策略梯度方法,特别是群组感知近端策略优化(PPO)的变体,如GRPO和GSPO。在AMZN、AAPL和GOOG等金融资产上的回测表明,这些新策略在净利润、盈利能力和回撤方面优于Q-Learning基线。

  3. RESEARCH · CL_29077 ·

    开源 AntAngelMed 模型以 103B 参数提供高效医疗 AI

    研究人员推出 AntAngelMed,一个拥有 1030 亿参数的开源医疗语言模型。它采用了专家混合(MoE)架构,每次查询仅激活 61 亿参数,从而提高了效率。这种设计使其在 H20 硬件上能够以超过每秒 200 个 token 的速度,媲美 400 亿参数密集模型的性能。该模型支持 128K 上下文长度,并经历了包括在医学语料库上预训练、监督微调和强化学习在内的三阶段训练过程。