HumanEval
PulseAugur coverage of HumanEval — every cluster mentioning HumanEval across labs, papers, and developer communities, ranked by signal.
- instance of large-language models 90%
- developed alphaXiv 90%
- developed CatalyzeX 90%
- used by GSM8K 70%
- used by large-language models 70%
- used by ScienceCast 70%
- used by DagsHub 70%
- used by Gotit.pub 70%
- instance of GSM8K 60%
- instance of mathematics-dataset 60%
- used by mathematics-dataset 60%
- competes with GSM8K 50%
10 天有情绪数据
-
AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难
一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。
-
新的LoRA-GA^2算法增强大型模型微调
研究人员推出LoRA-GA^2,这是一种新颖的微调算法,旨在改进现有大型模型的低秩适应(LoRA)方法。这种新方法利用了多步梯度信息(以前的方法未能完全捕捉),以更好地使LoRA更新与完全微调的结果保持一致。LoRA-GA^2包含一个轻量级多步梯度探测器、一个感知频谱的秩分配以及最优初始化,所有这些都不会增加GPU内存使用量。实验结果表明,LoRA-GA^2在GLUE、GSM8K和HumanEval等基准测试中优于其他LoRA变体。
-
新方法自动演进AI评估指标
研究人员开发了一种名为EvalCEGAR的新颖方法,用于自动生成AI代理的评估指标,特别适用于报告生成等人工评分困难的任务。该方法使用了一组小的Python算子,用于标记AI生成内容中的特定缺陷。通过采用类似程序验证技术的反例引导抽象细化,EvalCEGAR搜索被算子错误地相同评分的AI输出对。此过程会迭代地改进算子,以提高其准确性并减少误报数量,从而显著缩小在基准数据集上随机猜测与完美过滤之间的差距。
-
在没有验证的情况下,自我纠错方法未能改善大型语言模型代码生成
arXiv上的一项新研究调查了大型语言模型(LLMs)在代码生成中自我纠错方法的有效性。研究人员发现,虽然一些不确定性估计技术与正确性之间存在微弱的相关性,但它们并不能可靠地提高在HumanEval和BigCodeBench等基准测试上的性能。只有基于验证的自我纠错(涉及代码执行)显示出准确性的持续提高,这表明仅凭不确定性信号不足以提高代码生成的质量。
-
Anthropic 的 Claude 3.5 Sonnet 在基准测试中超越 Opus,成为构建者的默认选择
Anthropic 发布了 Claude 3.5 Sonnet,这是一款新的中端模型,在推理和编码基准测试中超越了其前旗舰 Claude 3 Opus。此次发布显著提高了成本效益比,使 Sonnet 3.5 成为生产环境中 AI 应用的推荐选择,尤其是在涉及智能体编码任务时。该模型比其前代产品更快、更便宜、更智能,在视觉能力和图像文本转录方面取得了显著进步。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
ISO-Grounded NFRs 改进 LLM 代码质量,但不总是改进正确性
一篇新的研究论文探讨了如何通过将非功能性需求 (NFRs) 基于 ISO/IEC 25010 质量模型来改进大型语言模型 (LLM) 的代码生成。研究发现,使用富文本自然语言或结构化 JSON 来指定 NFRs 可以增强静态质量指标并降低对提示变化的敏感性,尽管它不能持续提高功能正确性。研究表明,NFRs 的语义内容比其格式更重要,这表明实践者应关注基于标准的 NFR 内容。
-
新系统解决对话中 LLM 行为复发问题
研究人员开发了一个名为“sysname”的新系统,以解决大型语言模型(LLM)在多轮对话中行为复发的问题。这种复发发生在 LLM 继续遵守已撤销的约束时,该论文将这种现象称为“撤销惯性”。该系统引入了一个合同分类账来跟踪约束和撤销,一个顺序消融探针来衡量依从性,以及一个修复梯队进行干预。在 HumanEval 任务上的实验表明,与基线方法相比,sysname 显著减少了复发,并为对话状态失败提供了一种可衡量且可预测的修复机制。
-
研究发现:LLM 生成的代码未能满足开发者的意图
arXiv 上发表的一项新研究介绍了一个名为 DevIntent 的基准,旨在衡量大型语言模型 (LLM) 生成的代码在多大程度上违背了开发者隐含的意图。研究发现,尽管 Claude Sonnet 4.6 和 OpenAI GPT 4.1 模型通过了超过 92% 的明确测试,但在超过一半的问题中未能遵守未声明的约束。这表明当前的基准可能高估了 LLM 生成代码的质量和对开发者意图的遵守程度。
-
新方法将线性注意力改造到扩散语言模型中以加速其运行
研究人员开发了一种将线性注意力改造到扩散语言模型(dLLMs)中的方法,以加速推理。这种名为块混合注意力(block-hybrid attention)的新方法将精确的softmax注意力与活动去噪块结合,并对之前的块应用线性注意力。当应用于LLaDA~2.1模型并生成LLaDA-Hybrid时,它实现了高达1.7倍的解码吞吐量提升,并提高了内存效率,同时在HumanEval和MBPP+等基准测试中性能没有明显下降。
-
大型语言模型性能各异;特定任务能力比排名更重要
一项最新实验显示,即使在使用相同的任务和参数时,大型语言模型的性能也会有显著差异,这挑战了“单一最佳”模型的概念。在对 164 个 HumanEval+ 问题进行的两轮测试中,排名靠前的模型位置发生了互换,Qwen3 235B 从第三名升至第一名,而 GPT-OSS 120B 则从第一名跌至第三名。研究表明,模型的性能取决于具体任务,依赖单一模型可能会错失显著的性能提升机会,因为结合多个模型的输出来实现更高的准确性是可能的。
-
新的ABC-GRPO算法增强了LLM训练的稳定性和性能
研究人员推出了一种名为全象限有界裁剪GRPO(ABC-GRPO)的新型算法,旨在提高大型语言模型(LLM)强化学习的稳定性和泛化能力。ABC-GRPO通过在似然比和优势空间的全部四个象限上应用无条件裁剪,解决了现有组相对策略优化(GRPO)方法中存在的无界盲点。这种新方法在使用Qwen3基础模型进行的数学推理任务上表现出卓越的性能,与GRPO、SAPO和双裁剪PPO相比,在Avg@64和Pass@64上取得了更高的分数,同时还保持了更…
-
Qwen3 235B 领跑 Agentic Benchmark,凸显工具使用差异
Agentic Index 是一个用于评估多步任务完成、工具使用和错误恢复能力的基准测试,其结果与传统的聊天模型排行榜显示出显著差异。Qwen3 235B,一个混合专家模型(Mixture-of-Experts),在该指数上取得了最高分。这凸显了选择能够准确反映代理预期工作流程的基准测试的重要性,因为在单轮推理中表现出色的模型在复杂的多轮代理任务中可能会 falter。
-
AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM
AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…
-
Claude 3.5 Sonnet 在 AI 代码审计基准测试中领先,超越 GPT-4o 和 Llama 3
一项最新基准测试评估了 GPT-4o、Claude 3.5 Sonnet 和 Llama 3 70B 在自动化代码审计方面的有效性,特别是检测智能合约中的漏洞。Claude 3.5 Sonnet 在准确性方面表现最佳,正确识别了所有关键缺陷,并提供了零幻觉的安全代码补丁。GPT-4o 在速度和遵循结构化 JSON 输出方面表现出色,但错误地标记了一个不存在的漏洞。Llama 3 在本地运行时,提供了最快的响应时间和隐私优势,但在纯 J…
-
CodexGraph系统增强了LLM与代码仓库的交互能力
研究人员开发了CodexGraph,一个旨在改进大型语言模型(LLMs)与整个代码仓库交互方式的新系统。与依赖相似性检索或特定任务API的现有方法不同,CodexGraph将LLM代理与从代码中提取的图数据库接口集成。这种方法允许LLMs构建和执行精确的、结构感知的查询,以进行上下文检索和代码导航。CodexGraph在CrossCodeEval、SWE-bench和EvoCodeBench等学术基准测试以及实际软件工程应用中都展现了…
-
新研究质疑代码修复代理循环的可靠性
一篇题为“循环并非可靠性”(Looping Is Not Reliability)的新研究论文探讨了当前代码代理修复方法的局限性。研究强调,在生成-测试-修订循环中简单的重复并不能保证可靠性,反而可能导致错误。研究人员提出了一种新的、具有机械可执行子集的、基于状态边界的类型化循环契约,以改进代码修复的验证和提交过程。
-
grug-27b 模型发布,通过高效推理大幅减少 token 使用量
一款名为 grug-27b 的新模型已发布,该模型基于 Qwen/Qwen3.6-27B,专注于高效推理。它采用了 LoRA 方法和新颖的“仅思考”损失函数对代理轨迹进行训练,显著减少了 token 使用量,同时保持了高质量的输出。该模型通过在包含标准和剥离历史的代理重放的多种数据上进行训练,旨在避免大型模型中出现的重复循环问题。
-
Bad Theory Labs 发布 BTL-3 代码任务代理模型
Bad Theory Labs 发布了 BTL-3,一个拥有 270 亿参数的开放权重模型,专为代理编码和结构化工具使用而设计。该模型是 Qwen3.6-27B 的后训练版本,在 HumanEval 等编码基准测试中表现强劲,通过率为 95.1%。BTL-3 还拥有 262,144 个 token 的大上下文窗口,并根据 Apache-2.0 许可提供,同时还有一个为本地推理优化的精简版。
-
中国开源大模型比GPT-5节省成本
来自中国的开源大语言模型正成为GPT-5等模型的经济高效替代方案,一些初创公司报告了显著的成本节约。这些模型利用高效的混合专家(MoE)架构,并受益于中国较低的基础设施成本。TokenEase等平台通过统一的API使这些模型能够全球访问,简化了寻求在不牺牲质量的情况下降低费用的开发者的迁移过程。