Qwen2.5 Coder
PulseAugur coverage of Qwen2.5 Coder — every cluster mentioning Qwen2.5 Coder across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的APR评估指标揭示了稠密模型与MoE模型的权衡
一篇新的研究论文介绍了一个用于自动化程序修复(APR)模型的多维度评估框架,超越了简单的测试通过率指标。提出的加权质量指数(QI),灵感来自ISO/IEC 25010,纳入了功能正确性、可维护性、安全性和生成效率。当应用于Qwen2.5-Coder和DeepSeek-Coder-V2 Lite模型在错误数据集上的表现时,研究发现模型排名根据QI的加权方案而变化,突显了单一指标评估常常忽略的权衡。值得注意的是,DeepSeek-Code…
-
LLM基准测试:自行车上的鹈鹕展示了两年来的快速进展
在过去的两年里,Simon Willison 使用了一个独特的基准测试来追踪大型语言模型的进展:生成一个骑自行车的鹈鹕的SVG。最初,模型在处理这项任务时很困难,生成抽象的形状和无意义的解释。然而,到2025年中期,DeepSeek R1和Nvidia的产品等模型显示出显著的改进,有些甚至开始“编辑化”,拒绝提示或添加创意元素。一场使用GPT-4.1 mini作为裁判的比赛揭示了Gemini 2.5 Pro预览版在代码生成和图像合成方…
-
AI模型评估可能因接口审查而产生误导
一项新的研究论文强调了一种称为“接口诱导的轨迹审查”的现象,即用于评估AI模型的接口可能会错误地报告零工具使用,即使模型正在生成有效的工具调用。在BFCL v4、Qwen2.5-Coder和Llama-3.1-8b等各种模型中都观察到了这个问题,同一个模型仅根据使用的服务适配器就会显示出截然不同的性能指标。该论文指出,这种审查效应与规模有关,并且可能发生在训练循环本身中,从而影响观察到的工具调用率,而工具调用率是模型-接口堆栈的属性,…
-
离线AI安全扫描器通过多阶段流水线避免LLM幻觉
一款名为AiSec Studio的新型AI安全扫描平台已被开发出来,以解决大型语言模型(LLM)产生幻觉的问题。与将原始数据直接输入LLM的传统AI扫描器不同,AiSec Studio采用了多阶段流水线。该流水线首先使用确定性解析器和规则引擎来识别潜在漏洞,然后填充知识图谱。只有在完成这些步骤后,本地LLM才会处理结构化的发现摘要,以提供解释和推理,而不是自行发现漏洞。这种方法旨在提供更准确、可审计的安全报告。
-
新框架提升LLM生成代码质量
研究人员开发了一个新框架,以提高大型语言模型(LLM)生成的代码的非功能性质量。该方法包括创建一个包含有质量问题和无质量问题的代码的数据集,实施一种自适应令牌加权机制来关注质量敏感的代码区域,并使用混合优化目标。在DeepSeek-Coder和Qwen2.5-Coder等模型上的实验表明,在保持功能正确性的同时,代码符合编码标准的程度显著提高,微调一个7B模型耗时不到三小时。
-
新研究将LLM代理中的隐藏状态识别为持久语义实体
一篇新的研究论文引入了持久语义实体(PSE)的概念,用于描述工具增强的LLM代理中的隐式状态。这些实体可以在会话之间持久存在并在代理之间传播,但标准调试方法几乎无法检测到它们。研究发现,所有经过测试的模型,参数量从1.5B到1T不等,都容易受到PSE的影响,其中名称绑定是主要机制。由于许多模型中存在持久性且缺乏自我纠正能力,偏好和指令污染被确定为特别令人担忧的攻击面。
-
大型语言模型集成到硬件设计和设备端应用中
研究人员正在探索将大型语言模型(LLMs)集成到硬件设计和设备端应用中。一篇论文讨论了如何保护芯片小片系统和LLM驱动的电子设计自动化(EDA)流程免受硬件攻击。另一个框架RooflineBench旨在通过分析设备端LLM在资源受限硬件上的性能特征来进行基准测试。此外,还在进行实际实验,以测试消费级硬件上本地LLM的能力,评估它们在编码任务中的性能以及从二进制代码中识别处理器架构的能力。
-
2026年笔记本电脑本地编码的5款LLM
作者重点介绍了五款适合在2026年笔记本电脑上本地运行的大型语言模型,并强调较小的量化模型现在能够处理重要的编码任务。Qwen2.5-Coder因其完善度和生态系统被推荐为默认模型,而DeepSeek-R1-Distill-Qwen-14B因其详细的推理能力而成为复杂调试的首选。微软的Phi-4 14B因其高效、结构化的输出而受到关注,Bonsai 27B则被展示为一个通过新颖的低比特量化挑战传统大小-性能权衡的模型。
-
新的 TerminalTraj 管道生成大规模终端智能体轨迹
研究人员开发了 TerminalTraj,一个旨在为训练智能体模型生成大规模、可执行、可验证的终端轨迹的新管道。该系统解决了创建多样化 Docker 化环境和确保任务可验证性的挑战。该管道已被用于整理 32,000 个 Docker 镜像,并在八个领域生成了超过 50,000 条已验证的轨迹。使用 Qwen2.5-Coder 主干在该数据上训练的模型在 TerminalBench 基准测试中表现出显著的性能提升,其中 Terminal…
-
自托管 AI 分析师使用 Anthropic 的 MCP 查询数据库
已开发出一款自托管的 AI 数据分析师,允许用户使用自然语言查询 PostgreSQL 数据库。该系统利用了 Anthropic 推出的开放标准模型上下文协议 (MCP),使本地语言模型能够在不将数据发送到外部服务器的情况下与外部工具和数据源进行交互。设置涉及 Docker、用于运行本地 LLM 的 Ollama 以及一个在模型和数据库之间架起桥梁的 Python 服务器,该服务器能够通过 Python 库生成图表。
-
研究发现:量化对代码生成模型影响不同
一项新研究调查了各种量化方法对大型代码生成模型在资源受限硬件上运行时性能的影响。研究人员使用 Python 和 Java 基准测试,在 Qwen2.5-Coder 和 CodeLlama 模型上评估了包括 GPTQ、AWQ 和 AQLM 在内的六种最先进技术。研究结果表明,量化方法对代码的正确性和质量有显著且不同的影响,其中 AQLM 的表现与全精度模型相当,而 QuIP# 的性能下降最大。
-
开发者分享使用Ollama构建本地AI助手的指南
两位开发者详细介绍了如何设置本地AI助手,他们使用了Ollama,一个允许用户在自己的机器上运行大型语言模型的工具。其中一个指南侧重于使用Python和PyQt6创建一个轻量级、注重隐私的桌面应用程序,强调了UI与LLM后端分离的模块化架构。另一个指南概述了一个本地AI编码代理的工作流程,将Ollama与Aider集成在Windows Subsystem for Linux (WSL)中,以实现更流畅的开发环境。
-
Qwen3-Coder 32B 在2026年领先本地AI编码模型
Qwen3-Coder 32B 模型已成为2026年顶级的本地编码助手,其性能可与 Claude Sonnet 4 和 GPT-4o 等云端解决方案相媲美。该模型由阿里巴巴的 Qwen 系列微调,HumanEval 得分为91.4%,可在 RTX 3090 GPU 等消费级硬件上运行,约需20GB显存。对于显存较小的用户,也提供了 Qwen3-Coder 14B 和 8B 等较小版本,提供了可行的本地AI解决方案,优先考虑数据隐私并免…
-
研究发现 LLM 代码审查偏好持续性而非正确性
一项使用本地 Qwen2.5-Coder 模型的实验表明,LLM 对代码进行重复审查,尤其是在启用采样的情况下,往往会收敛于持续性的发现而非准确的发现。当温度设置为 0 时,模型产生相同的结果,但将温度提高到 0.7 会引入显著的变异性。对这些不同发现进行多数投票,通常会选择一致但错误的错误报告,而不是频率较低但准确的报告,这凸显了在使用 LLM 生成的代码审查时可能存在的陷阱。
-
AI 赋能教育:从 K-12 技能到前沿模型协作
研究表明,AI 驱动的学习助手正日益融入高等教育,其使用模式因学生人口统计特征和学习模式而异。与此同时,一项关于前沿 AI 教师的研究强调,模型之间的协作,而非简单的模仿,是为学生模型开发有效 AI 课程的关键。另一篇论文探讨了 AI 如何通过提供智能脚手架来变革 STEM 教育,将重点从知识传授转向能力培养。此外,一个面向幼儿的实时 AI 导师强调了亚秒级响应时间和教学整合对于确保有效学习的至关重要性。
-
SpecCoder框架通过形式化规范增强代码大模型
研究人员开发了SpecCoder,一个旨在通过利用中间形式化规范来增强代码大模型推理能力的新框架。与自然语言不同,这些可执行的规范为代码验证、调试和修复提供了机器可检查的约束。SpecCoder使用经过验证的程序、改变行为的变异体和精炼跟踪来训练模型,以生成对正确代码有效但拒绝错误代码的规范。该框架在HumanExec基准上进行了评估,显示出Qwen2.5-Coder等模型在规范质量、正确性和完整性方面有了显著的改进。
-
本地部署的开源大模型Text-to-SQL:Qwen2.5和Llama-3.x领先,生成能力胜过模型尺寸
一项新的基准研究评估了本地部署的开源大模型在Text-to-SQL任务上的性能,比较了不同的模型家族和尺寸。研究发现,较新一代的模型,如Qwen2.5-Coder和Llama-3.x,在相同尺寸下显著优于CodeLlama等旧模型。研究还强调,自纠正技术以最小的计算成本提供了显著的改进,而模式链接和自洽性方法则显示出有限的益处。
-
评估本地部署大语言模型在BIRD基准上的Text-to-SQL能力
一篇新论文使用BIRD基准评估了本地部署的、开源权重的大语言模型(LLMs)在Text-to-SQL任务上的性能。研究发现,较新的模型一代,如Qwen2.5-Coder和Llama-3.x,在同等规模下显著优于CodeLlama-Instruct等旧模型。诸如自我纠错等关键技术在不同模型家族中均显示出持续的优势,而模式链接(schema linking)未带来可衡量的改进,自洽性(self-consistency)因计算成本高而价值不高。
-
开发者构建本地机器学习流水线以阻止有风险的代码提交
一位最近的计算机科学毕业生开发了一个本地机器学习流水线,旨在防止有风险的代码提交在推送之前被提交。该流水线集成了三个检查层:一个用于已知敏感信息格式的Rust正则表达式通道,一个用于更危险模式(如不安全子进程调用)的CoreML分类器,以及一个本地LLM(Qwen2.5-Coder),用于标记潜在的注入风险或死代码,但不会阻止提交。该项目目前仅限于Apple Silicon,因为它依赖于CoreML和MLX,旨在通过提供更细致的风险检…
-
新框架增强大型语言模型从示例合成程序的能力
研究人员开发了一个名为 PRM-PBE 的新框架,以增强大型语言模型 (LLM) 在编程示例 (PBE) 任务中的能力。该方法解决了当前 LLM 在 PBE 中的局限性,由于缺乏对中间推理过程的细粒度监督,它们通常难以从有限的输入输出示例中推断出底层程序逻辑。PRM-PBE 利用在反馈引导的推理树上训练的进程奖励模型 (PRM) 来评估中间步骤的可靠性,并结合三阶段课程学习方法和 PPO 优化来进行程序合成。在多个基准测试上的实验表明…