PulseAugur
实时 14:55:18
实体 Qwen2.5-Coder-3B

Qwen2.5-Coder-3B

PulseAugur coverage of Qwen2.5-Coder-3B — every cluster mentioning Qwen2.5-Coder-3B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_160655 ·

    EvoSQL框架通过批评-生成器协同进化增强文本到SQL

    研究人员开发了EvoSQL,一个新颖的框架,旨在通过将SQL合成视为生成器和批评者之间的迭代过程来增强文本到SQL的能力。该系统包含一个内存组件来存储和验证SQL候选,利用执行信号和基于LLM的批评进行优化。EvoSQL还包括一个自蒸馏策略优化(SDPO)阶段,以执行感知的监督来微调编码LLM,在Spider和BIRD等基准数据集上取得了显著改进,特别是对于Qwen3-4B和Qwen2.5-Coder-3B等开源模型。

  2. TOOL · CL_106154 ·

    中国研究人员发布 VibeThinker-3B,一个可媲美更大模型的紧凑型 3B 模型

    中国研究人员开发了 VibeThinker-3B,一个紧凑型的 30 亿参数密集推理模型。该模型基于 Qwen2.5-Coder-3B 构建,并利用 Spectrum-to-Signal 训练,在数学和编码任务上取得了与更大模型相当的性能。值得注意的是,它在 AIME26 基准测试中得分 94.3%,可与规模大得多的 DeepSeek V3.2 模型相媲美,并且可以在单个 GPU 上运行。

  3. RESEARCH · CL_98026 ·

    AI 研究:SFT 过度训练导致代码生成模型排名反转

    一篇新的研究论文探讨了在强化学习与人类反馈(RLHF)用于代码生成模型时,监督微调(SFT)过度训练的现象。该研究以 Qwen2.5-Coder-3B 和 DeepSeek-Coder-6.7B 为例,发现 SFT 会压缩奖励的分布,导致排名反转,即最初有希望的检查点在 RLHF 后表现不佳。研究人员提出了一种使用预 RL 和早期 RL 熵监测的两阶段诊断方法,以识别并停止失败的运行,并指出标准的正则化技术未能解决该问题。

  4. RESEARCH · CL_94915 ·

    新的 3B 模型 VibeThinker 在数学和编码方面达到前沿性能

    研究人员开发了 VibeThinker-3B,这是一个拥有 30 亿参数的小型模型,在数学和编码任务上的表现可与更大模型相媲美。该模型基于 Qwen2.5-Coder-3B 构建,并采用了 Spectrum-to-Signal 训练流程,在 AIME26 和 LiveCodeBench 等基准测试中取得了优异成绩。开发者强调,参数密集的小型模型可以提供前沿的推理能力,是对传统扩展定律的补充,但他们也承认在更广泛的通用应用方面存在局限性。

  5. TOOL · CL_94291 ·

    新AI框架训练代码模型自我修正安全漏洞

    研究人员开发了一个名为Tree Self-Play (TSP) 的新颖框架,以解决在代码上训练的大型语言模型中固有的安全漏洞。当前的监督微调和强化学习等方法过于粗粒度,无法修复导致SQL注入等问题的局部编码错误。TSP引入了一种细粒度的、自主的方法,能够精确识别代码中的风险节点,并利用自我博弈生成安全和易受攻击的代码路径,以进行有针对性的优化。