HumanEval
PulseAugur coverage of HumanEval — every cluster mentioning HumanEval across labs, papers, and developer communities, ranked by signal.
- used by GSM8K 90%
- instance of GSM8K 90%
- instance of large-language models 90%
- developed alphaXiv 90%
- developed CatalyzeX 90%
- used by large-language models 70%
- instance of DagsHub 70%
- used by alphaXiv 70%
- instance of ScienceCast 70%
- instance of Gotit.pub 70%
- used by ScienceCast 70%
- used by Gotit.pub 70%
8 天有情绪数据
-
新SPECTRUM方法增强AI代码生成多样性
研究人员推出了一种新颖的循环自蒸馏框架SPECTRUM,旨在改进代码生成模型。与可能导致正确解多样性收缩的传统自蒸馏方法不同,SPECTRUM旨在保留更广泛的正确实现方法。该方法通过重新估计键/值几何结构并应用谱调制来实现这一点,使单个学生模型能够在没有外部评估的情况下从更广泛的生成输出来学习。在MBPP、HumanEval和APPS Intro等基准测试上的实验表明,SPECTRUM在保持和转移解多样性方面显著优于普通自蒸馏。
-
AI模型基准测试的可靠性和误差范围受到质疑
一位Reddit用户对AI模型基准测试得分的可靠性表示担忧,认为报告的改进通常在误差范围内。用户指出,小数据集和测试方法学的差异可能导致误导性结果,使得难以区分真正的进展。他们主张采用置信区间和多重测试种子等统计方法,以更准确地反映模型性能。
-
新方法以最少数据将AR模型转换为扩散LLM
研究人员开发了一种低成本方法,将自回归(AR)模型转换为扩散语言模型(dLLM),从而无需大量重新训练即可实现并行生成。一项比较两种转换技术(就地转换和冻结塔转换)的研究发现,在HumanEval等基准测试中,冻结塔模型显著优于就地转换模型,实现了11.6倍的改进。冻结塔方法在GSM8K和MMLU-Pro任务上还保留了父模型更高百分比的性能,表明它在转换过程中更有效地保留知识,尤其是在有限的训练预算内。
-
新的IntentCoding策略提高了LLM代码生成对用户意图的遵循度
研究人员开发了一种名为IntentCoding的新解码策略,以提高大型语言模型(LLMs)在代码生成中遵循复杂用户指令的能力。该策略在不要求额外模型训练的情况下,增强了用户意图在生成过程中的影响力。为了便于评估,创建了一个名为CodeConstraints的新基准数据集,专门用于测试对多重约束的遵循情况。实验表明,与标准解码方法相比,IntentCoding在约束满足度和功能正确性方面均有显著提升。
-
新AI训练方法无需参数调整即可提升模型推理能力
研究人员开发了一种名为On-Policy Power Distillation (OPPD) 的新颖方法,用于训练语言模型以提高其推理能力,而无需外部评分或参数更改。OPPD直接训练模型生成更优化的答案,有效地将概率转移到模型最可能正确的响应上。该技术在MATH500、GSM8K和HumanEval等多个基准测试中显示出显著的准确性提升,优于GRPO等现有方法,并取得了与广泛候选采样相当的收益。
-
新的SURGE技术无需额外训练即可增强RL模型
研究人员开发了一种名为SURGE(Scaling Up RL Gradient-free via Eigenspace fusion)的新技术,可以在不增加额外训练时间或推理计算的情况下,提高现有强化学习(RL)模型的性能。SURGE结合了同一RL训练历史中的两个检查点,生成了一个优于两个原始检查点的新策略。该方法在数学推理和编码基准测试中均显示出改进,证明了存储的RL历史是扩展模型能力的宝贵资源。
-
MIRROR 原始机制可防御针对 LLM 多智能体通信的攻击 · 已追踪 2 个来源
研究人员推出了一种新颖的通信层完整性原始机制 MIRROR,旨在保护大型语言模型多智能体系统 (LLM-MAS) 免受中间人攻击 (AiTM)。MIRROR 将消息复制到多个逻辑路径,仅当严格多数路径报告相同的摘要时才接受消息,从而防止传输中的消息被篡改。在跨各种基准和框架的测试中,此方法有效地将攻击成功率降至 0%,同时与 LLM-as-a-Judge 等替代方法相比,计算成本极低。
-
新研究探索自监督学习在公平性、效率和多样化输出方面的应用
多篇研究论文探讨了自监督学习(SSL)的进展,这是一种在无标签数据上训练模型的技术。其中一项研究FairSSL,通过利用数据异质性和主题感知正则化,引入了一个框架来提高多模态SSL的公平性。另一篇论文研究了增加网络宽度如何使贪婪的逐层训练在SSL中能与端到端反向传播相媲美,尤其是在更宽的网络中。进一步的研究深入探讨了哪些下游任务最能从SSL中受益,发现它在异常检测和分类方面有效,但在预测方面效果不佳。此外,一种名为DRY-SFT的新方…
-
新的 MoMHa 系统优化 LLM Harness,平衡准确性、安全性和 Token 成本
研究人员开发了 MoMHa,一个用于优化大型语言模型 (LLM) Harness 的新系统。与以往只关注准确性的方法不同,MoMHa 将准确性、行为安全性和 Token 成本视为多目标标准。该系统利用一个具有代理功能的提案者 Claude Code,该提案者可以广泛访问先前的 Harness 设计和执行数据,以搜索最优的 Harness 配置。在合成和真实世界基准测试中,使用 12 种不同模型的评估表明,MoMHa 在联合奖励、行为安…
-
新研究探索Transformer模型的效率和稳定性
研究人员正在探索新的方法来提高Transformer模型的效率和性能,特别是那些采用循环的Transformer模型。其中一种方法LoopCD提供了一个无需训练的框架,通过对比最终预测与早期循环传递来提高解码质量,在代码生成和推理等任务中取得了显著的进步。另一个研究领域侧重于理解和稳定深度图Transformer,分析其动力学系统以防止表示崩溃并改进图生成。此外,研究正在调查循环Transformer如何在共享权重中路由计算,表明中间…
-
新的SCALE方法通过控制特征使用来增强SFT
研究人员推出了一种名为SCALE(Selective Control of Adaptation via Local Entropy,通过局部熵选择性控制适应)的新型监督微调(SFT)方法,旨在通过控制学习到的特征的使用方式来改进模型适应性。与专注于抑制或放大更新的现有方法不同,SCALE冻结了预训练模型和SFT增量,学习门控机制,根据熵减少来抑制、反转或外推特征。这种方法在多个Qwen模型(包括Qwen2.5-Math-1.5B、Q…
-
Qwen2.5-Coder 3B模型的Ollama标签无法生成代码
用户遇到一个问题,即Qwen2.5-Coder 3B模型的一个特定Ollama标签(q3_K_M量化级别)无法生成功能性代码。尽管模型正常加载并处理请求,但对于简单的编码任务,它却产生了无意义的输出。然而,这种失败并非由于量化级别本身,因为同一模型和量化级别的官方Qwen GGUF版本,在使用正确的模板导入后,成功解决了相同的任务。
-
Mistral Small 3.2 发布,增强了函数调用和 128K 上下文
Mistral AI 发布了 Mistral Small 3.2,这是一个开放权重模型,具有改进的函数调用和 128K 上下文窗口。此次更新增强了模型处理工具区分的能力,并为多轮对话提供更清晰的 JSON 输出。虽然在推理基准测试中与 GPT-4o mini 等模型具有竞争力,但 Mistral Small 3.2 在需要大上下文窗口和可靠工具编排的场景中表现尤为出色,提供了经济高效的自托管选项。
-
OpenAI 的 GPT OSS 20B 在 Mac 上的速度和编码基准测试中领先
在配备 24GB 内存的 Apple M2 机器上,对三款开源大模型——OpenAI 的 GPT OSS 20B、阿里巴巴的 Qwen3 14B 和 Mistral AI 的 Mistral-Small 24B——进行了比较。GPT OSS 20B 速度最快,比 Qwen3 14B 快三到四倍,并在 GSM8K 和 HumanEval+ 基准测试中取得了满分。然而,Qwen3 14B 在原始知识方面表现最佳,MMLU 得分为 82%,…
-
研究发现:大型语言模型推理表现出超越价值对齐的非理性
arXiv上的一篇新研究论文探讨了大型语言模型中“理性价值风险”的概念,指出即使是经过良好对齐的模型在推理过程中也可能表现出非理性。这种风险被量化为模型已部署的推理策略与其理性最大化对齐效用的策略之间的差异。该研究在多个基准测试中测试了包括Llama-3.1、Qwen-2.5、Tülu-3、GPT-5.2、GPT-5.5和DeepSeek-V4在内的模型,发现这种风险普遍存在。虽然价值对齐可以减少但不能消除这种非理性,但诸如自洽性(s…
-
新的PRACT-120基准旨在全面评估AI聊天机器人
一个名为PRACT-120的新基准被提出,旨在比现有的MMLU或GPQA等测试更全面地评估AI聊天机器人。该基准旨在评估的不仅是核心模型的能力,还包括定义聊天机器人用户体验的集成工具和功能,例如网络搜索、PDF分析和文档编辑。这种方法认识到聊天机器人的整体效用取决于其功能生态系统,而不仅仅是原始语言理解能力。
-
新的DARTS技术通过熵加权损失改进了解码器LLM合并
研究人员开发了一种名为DARTS(Decoder-Aware Representation Tuning via Surgery,解码器感知表示调整手术)的新技术,以改进基于解码器的LLM的模型合并。与以前用于编码器模型的方法不同,DARTS解决了解码器架构的独特挑战,例如跨token位置的偏差累积以及不同token位置的不同重要性。该方法使用熵加权损失函数来优先处理关键决策位置的校正,并结合了每位置的加性偏差来捕获位置相关的错误。
-
研究详细介绍了更快扩散语言模型的服务挑战
一篇新的 arXiv 研究论文探讨了服务掩码扩散语言模型(dLLM)的挑战,dLLM 通过同时去噪多个 token,可以比传统的自回归模型更快地生成文本。该研究使用 NVIDIA H200 GPU 上的 LLaDA-8B-Instruct 和 D2F LoRA 适配器,发现请求的难度是离散的,而不是连续的,请求分为 11 个固定的步数级别。具有较短生成预算的基准测试可能会低估服务方差,并且相当一部分挂钟时间花在 CPU 端的分发开销上…
-
AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难
一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。
-
新的LoRA-GA^2算法增强大型模型微调
研究人员推出LoRA-GA^2,这是一种新颖的微调算法,旨在改进现有大型模型的低秩适应(LoRA)方法。这种新方法利用了多步梯度信息(以前的方法未能完全捕捉),以更好地使LoRA更新与完全微调的结果保持一致。LoRA-GA^2包含一个轻量级多步梯度探测器、一个感知频谱的秩分配以及最优初始化,所有这些都不会增加GPU内存使用量。实验结果表明,LoRA-GA^2在GLUE、GSM8K和HumanEval等基准测试中优于其他LoRA变体。