DeepSeek-R1-Distill-Qwen-1.5B
PulseAugur coverage of DeepSeek-R1-Distill-Qwen-1.5B — every cluster mentioning DeepSeek-R1-Distill-Qwen-1.5B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的MADA-RL框架通过参数高效的辩论学习提升紧凑模型的推理能力
研究人员开发了MADA-RL,一个新颖的训练后框架,旨在利用参数高效的方法增强紧凑型语言模型(40亿参数以下)的推理能力。该框架使用独特的辩论感知学习信号来训练专门的生成器和评估器模型,仅通过LoRA适配器微调一小部分参数。MADA-RL在DeepSeek-R1-Distill-Qwen-1.5B模型的数学推理基准测试中展示了2.0个百分点的准确率提升,并且与完全微调相比,可训练参数数量显著减少。
-
新的解码监控器改进了量化推理模型
研究人员开发了一种名为 Calibrated e-CUSUM Decoding 的新解码监控器,旨在提高量化推理模型的可靠性。研究表明,使用 token log-probability 的传统方法不足以检测生成失败。所提出的方法结合了警报分数和序列检测器来识别不可靠的轨迹,在提高准确性和减少 DeepSeek-R1-Distill-Qwen-1.5B 等模型的退化信号方面显示出潜力。
-
新的 DRA-GRPO 方法通过鼓励多样化路径来提升 LLM 数学推理能力
研究人员推出了一种新颖的 DRA-GRPO 框架,旨在通过解决标准 GRPO 方法中固有的多样性-质量不一致性来增强大型语言模型的数学推理能力。这种新方法使用语义密度和子模互信息来校准奖励信号,以消除梯度估计的偏差,鼓励模型探索更广泛的有效推理策略。在五个数学基准上的实证结果表明,DRA-GRPO 的性能显著优于现有方法,在训练样本数量有限且成本较低的情况下,在 DeepSeek-R1-Distill-Qwen-1.5B 数据集上达到…
-
经济型PC LLM测试:LFM2.5-1.2B-Instruct在通用场景下胜出
一位开发者在一台没有独立GPU的标准办公PC上测试了五个小型LLM(参数量小于20亿),以确定在经济型硬件上哪些模型表现最佳。测试重点关注了每秒令牌数速度和创意写作质量,特别是生成有趣的猫咪故事。LFM2.5-350M速度最快,适合快速任务,而LFM2.5-1.2B-Instruct在仅CPU系统上提供了通用场景下质量和性能的最佳平衡。
-
AI模型可解释地检测多囊卵巢综合征和饮食失调
研究人员开发了开源语言模型,用于检测社交媒体帖子中多囊卵巢综合征(PCOS)、身体意象困扰和饮食失调的三重负担。使用1000个与PCOS相关的帖子数据集,对三个模型(Gemma-2-2B、Qwen3-1.7B和DeepSeek-R1-Distill-Qwen-1.5B)进行了低秩适应(Low-Rank Adaptation)微调,以提供解释和文本证据。表现最佳的模型在独立测试集上达到了75.3%的准确率,展示了强大的合并症检测和可解释…