实体
DeepSeek-R1-Distill-7B
DeepSeek-R1-Distill-7B
PulseAugur coverage of DeepSeek-R1-Distill-7B — every cluster mentioning DeepSeek-R1-Distill-7B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的卡尔曼滤波方法提高了LLM RL微调的效率
研究人员开发了一种新颖的卡尔曼引导提示选择(KGPS)方法,以提高大型语言模型(LLM)的强化学习(RL)微调的效率和有效性。KGPS将提示难度建模为一个动态状态估计问题,使用卡尔曼滤波器来维护一个校准后的提示难度后验分布,该分布会随着训练过程中的策略漂移而调整。这种方法避免了额外的rollout需求,并已展示出最先进的性能,显著减少了rollout需求,同时提高了在各种推理基准上的准确性。
-
LLM 推理和推理技术随着新研究和硬件的进步而发展
研究人员正在探索新的方法来提高大型语言模型 (LLM) 的效率和推理能力。Google Research 正在开发训练 LLM 以贝叶斯方式进行推理的技术,从而提高它们更新概率估计和泛化到新任务的能力。同时,推理优化方面的进展包括“投机级联”,它将更小、更快的模型与更大的模型结合起来,以及“上下文回收”来管理长对话范围。此外,正在开发“级联多粒度剪枝”和“SharQ”等方法来压缩 LLM 以进行设备上推理,从而在保持准确性的同时降低延…