PulseAugur
中
实时 03:27:43
实体 Qwen2.5-Coder-3B

Qwen2.5-Coder-3B

PulseAugur coverage of Qwen2.5-Coder-3B — every cluster mentioning Qwen2.5-Coder-3B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_248925 ·

    CodeFinetuner 流水线支持本地代码模型微调

    CodeFinetuner 是一个新流水线,旨在对特定代码库上的本地代码补全模型进行微调。该流水线经过数月开发,支持 Qwen2.5-Coder-3B 等模型,可在 Mac (MPS) 或 NVIDIA GPU (CUDA) 上运行,并可选集成 Unsloth 以提高训练速度和减少 VRAM 使用量。该流水线将原始代码处理成结构感知示例,执行 LoRA 微调,使用 CodeBLEU 等指标评估结果,并将模型转换为 GGUF 格式以进行本地推理。

  2. TOOL · CL_245454 ·

    研究揭示公共库中存在沉默缺陷的大语言模型制品

    一项新研究论文强调了公共库中可用的大语言模型(LLM)制品完整性方面存在严重问题。研究发现,Ollama 和 Hugging Face 上部分社区库的官方制品中有 1.6% 存在沉默缺陷,这意味着它们在表面上统计正常的情况下无法执行任何任务。这些缺陷是通过严格的测试过程识别出来的,该过程包括多个推理后端以及与独立转换的比较,揭示出一些模型在 CUDA 等特定硬件上会显著降级,但在 Metal 等其他硬件上却能正常运行。研究人员已发布了…

  3. TOOL · CL_160655 ·

    EvoSQL框架通过批评-生成器协同进化增强文本到SQL

    研究人员开发了EvoSQL,一个新颖的框架,旨在通过将SQL合成视为生成器和批评者之间的迭代过程来增强文本到SQL的能力。该系统包含一个内存组件来存储和验证SQL候选,利用执行信号和基于LLM的批评进行优化。EvoSQL还包括一个自蒸馏策略优化(SDPO)阶段,以执行感知的监督来微调编码LLM,在Spider和BIRD等基准数据集上取得了显著改进,特别是对于Qwen3-4B和Qwen2.5-Coder-3B等开源模型。

  4. TOOL · CL_106154 ·

    中国研究人员发布 VibeThinker-3B,一个可媲美更大模型的紧凑型 3B 模型

    中国研究人员开发了 VibeThinker-3B,一个紧凑型的 30 亿参数密集推理模型。该模型基于 Qwen2.5-Coder-3B 构建,并利用 Spectrum-to-Signal 训练,在数学和编码任务上取得了与更大模型相当的性能。值得注意的是,它在 AIME26 基准测试中得分 94.3%,可与规模大得多的 DeepSeek V3.2 模型相媲美,并且可以在单个 GPU 上运行。

  5. RESEARCH · CL_98026 ·

    AI 研究:SFT 过度训练导致代码生成模型排名反转

    一篇新的研究论文探讨了在强化学习与人类反馈(RLHF)用于代码生成模型时,监督微调(SFT)过度训练的现象。该研究以 Qwen2.5-Coder-3B 和 DeepSeek-Coder-6.7B 为例,发现 SFT 会压缩奖励的分布,导致排名反转,即最初有希望的检查点在 RLHF 后表现不佳。研究人员提出了一种使用预 RL 和早期 RL 熵监测的两阶段诊断方法,以识别并停止失败的运行,并指出标准的正则化技术未能解决该问题。

  6. RESEARCH · CL_94915 ·

    新的 3B 模型 VibeThinker 在数学和编码方面达到前沿性能

    研究人员开发了 VibeThinker-3B,这是一个拥有 30 亿参数的小型模型,在数学和编码任务上的表现可与更大模型相媲美。该模型基于 Qwen2.5-Coder-3B 构建,并采用了 Spectrum-to-Signal 训练流程,在 AIME26 和 LiveCodeBench 等基准测试中取得了优异成绩。开发者强调,参数密集的小型模型可以提供前沿的推理能力,是对传统扩展定律的补充,但他们也承认在更广泛的通用应用方面存在局限性。

  7. TOOL · CL_94291 ·

    新AI框架训练代码模型自我修正安全漏洞

    研究人员开发了一个名为Tree Self-Play (TSP) 的新颖框架,以解决在代码上训练的大型语言模型中固有的安全漏洞。当前的监督微调和强化学习等方法过于粗粒度,无法修复导致SQL注入等问题的局部编码错误。TSP引入了一种细粒度的、自主的方法,能够精确识别代码中的风险节点,并利用自我博弈生成安全和易受攻击的代码路径,以进行有针对性的优化。