Qwen2.5-Coder-3B
PulseAugur coverage of Qwen2.5-Coder-3B — every cluster mentioning Qwen2.5-Coder-3B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
CodeFinetuner 流水线支持本地代码模型微调
CodeFinetuner 是一个新流水线,旨在对特定代码库上的本地代码补全模型进行微调。该流水线经过数月开发,支持 Qwen2.5-Coder-3B 等模型,可在 Mac (MPS) 或 NVIDIA GPU (CUDA) 上运行,并可选集成 Unsloth 以提高训练速度和减少 VRAM 使用量。该流水线将原始代码处理成结构感知示例,执行 LoRA 微调,使用 CodeBLEU 等指标评估结果,并将模型转换为 GGUF 格式以进行本地推理。
-
研究揭示公共库中存在沉默缺陷的大语言模型制品
一项新研究论文强调了公共库中可用的大语言模型(LLM)制品完整性方面存在严重问题。研究发现,Ollama 和 Hugging Face 上部分社区库的官方制品中有 1.6% 存在沉默缺陷,这意味着它们在表面上统计正常的情况下无法执行任何任务。这些缺陷是通过严格的测试过程识别出来的,该过程包括多个推理后端以及与独立转换的比较,揭示出一些模型在 CUDA 等特定硬件上会显著降级,但在 Metal 等其他硬件上却能正常运行。研究人员已发布了…
-
EvoSQL框架通过批评-生成器协同进化增强文本到SQL
研究人员开发了EvoSQL,一个新颖的框架,旨在通过将SQL合成视为生成器和批评者之间的迭代过程来增强文本到SQL的能力。该系统包含一个内存组件来存储和验证SQL候选,利用执行信号和基于LLM的批评进行优化。EvoSQL还包括一个自蒸馏策略优化(SDPO)阶段,以执行感知的监督来微调编码LLM,在Spider和BIRD等基准数据集上取得了显著改进,特别是对于Qwen3-4B和Qwen2.5-Coder-3B等开源模型。
-
中国研究人员发布 VibeThinker-3B,一个可媲美更大模型的紧凑型 3B 模型
中国研究人员开发了 VibeThinker-3B,一个紧凑型的 30 亿参数密集推理模型。该模型基于 Qwen2.5-Coder-3B 构建,并利用 Spectrum-to-Signal 训练,在数学和编码任务上取得了与更大模型相当的性能。值得注意的是,它在 AIME26 基准测试中得分 94.3%,可与规模大得多的 DeepSeek V3.2 模型相媲美,并且可以在单个 GPU 上运行。
-
AI 研究:SFT 过度训练导致代码生成模型排名反转
一篇新的研究论文探讨了在强化学习与人类反馈(RLHF)用于代码生成模型时,监督微调(SFT)过度训练的现象。该研究以 Qwen2.5-Coder-3B 和 DeepSeek-Coder-6.7B 为例,发现 SFT 会压缩奖励的分布,导致排名反转,即最初有希望的检查点在 RLHF 后表现不佳。研究人员提出了一种使用预 RL 和早期 RL 熵监测的两阶段诊断方法,以识别并停止失败的运行,并指出标准的正则化技术未能解决该问题。
-
新的 3B 模型 VibeThinker 在数学和编码方面达到前沿性能
研究人员开发了 VibeThinker-3B,这是一个拥有 30 亿参数的小型模型,在数学和编码任务上的表现可与更大模型相媲美。该模型基于 Qwen2.5-Coder-3B 构建,并采用了 Spectrum-to-Signal 训练流程,在 AIME26 和 LiveCodeBench 等基准测试中取得了优异成绩。开发者强调,参数密集的小型模型可以提供前沿的推理能力,是对传统扩展定律的补充,但他们也承认在更广泛的通用应用方面存在局限性。
-
新AI框架训练代码模型自我修正安全漏洞
研究人员开发了一个名为Tree Self-Play (TSP) 的新颖框架,以解决在代码上训练的大型语言模型中固有的安全漏洞。当前的监督微调和强化学习等方法过于粗粒度,无法修复导致SQL注入等问题的局部编码错误。TSP引入了一种细粒度的、自主的方法,能够精确识别代码中的风险节点,并利用自我博弈生成安全和易受攻击的代码路径,以进行有针对性的优化。