Qwen2.5-Coder-3B
PulseAugur coverage of Qwen2.5-Coder-3B — every cluster mentioning Qwen2.5-Coder-3B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
EvoSQL框架通过批评-生成器协同进化增强文本到SQL
研究人员开发了EvoSQL,一个新颖的框架,旨在通过将SQL合成视为生成器和批评者之间的迭代过程来增强文本到SQL的能力。该系统包含一个内存组件来存储和验证SQL候选,利用执行信号和基于LLM的批评进行优化。EvoSQL还包括一个自蒸馏策略优化(SDPO)阶段,以执行感知的监督来微调编码LLM,在Spider和BIRD等基准数据集上取得了显著改进,特别是对于Qwen3-4B和Qwen2.5-Coder-3B等开源模型。
-
中国研究人员发布 VibeThinker-3B,一个可媲美更大模型的紧凑型 3B 模型
中国研究人员开发了 VibeThinker-3B,一个紧凑型的 30 亿参数密集推理模型。该模型基于 Qwen2.5-Coder-3B 构建,并利用 Spectrum-to-Signal 训练,在数学和编码任务上取得了与更大模型相当的性能。值得注意的是,它在 AIME26 基准测试中得分 94.3%,可与规模大得多的 DeepSeek V3.2 模型相媲美,并且可以在单个 GPU 上运行。
-
AI 研究:SFT 过度训练导致代码生成模型排名反转
一篇新的研究论文探讨了在强化学习与人类反馈(RLHF)用于代码生成模型时,监督微调(SFT)过度训练的现象。该研究以 Qwen2.5-Coder-3B 和 DeepSeek-Coder-6.7B 为例,发现 SFT 会压缩奖励的分布,导致排名反转,即最初有希望的检查点在 RLHF 后表现不佳。研究人员提出了一种使用预 RL 和早期 RL 熵监测的两阶段诊断方法,以识别并停止失败的运行,并指出标准的正则化技术未能解决该问题。
-
新的 3B 模型 VibeThinker 在数学和编码方面达到前沿性能
研究人员开发了 VibeThinker-3B,这是一个拥有 30 亿参数的小型模型,在数学和编码任务上的表现可与更大模型相媲美。该模型基于 Qwen2.5-Coder-3B 构建,并采用了 Spectrum-to-Signal 训练流程,在 AIME26 和 LiveCodeBench 等基准测试中取得了优异成绩。开发者强调,参数密集的小型模型可以提供前沿的推理能力,是对传统扩展定律的补充,但他们也承认在更广泛的通用应用方面存在局限性。
-
新AI框架训练代码模型自我修正安全漏洞
研究人员开发了一个名为Tree Self-Play (TSP) 的新颖框架,以解决在代码上训练的大型语言模型中固有的安全漏洞。当前的监督微调和强化学习等方法过于粗粒度,无法修复导致SQL注入等问题的局部编码错误。TSP引入了一种细粒度的、自主的方法,能够精确识别代码中的风险节点,并利用自我博弈生成安全和易受攻击的代码路径,以进行有针对性的优化。