Reddit的r/MachineLearning板块的一位用户正在寻找学习On Policy Distillation (OPD)和On Policy Self Distillation (OPSD)算法的资源。他们特别关注这些方法与GRPO的对比,并正在寻找可以在Nvidia RTX 4090或5090等消费级GPU上运行的GitHub仓库或关于合适SLM和数据集的指导。 AI
排序理由 这是Reddit上的用户查询,寻求信息,而非新闻事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →