GSM8K
PulseAugur coverage of GSM8K — every cluster mentioning GSM8K across labs, papers, and developer communities, ranked by signal.
- instance of Gotit.pub 90%
- instance of Drop 90%
- used by Grpo 90%
- used by mathematics-dataset 70%
- instance of mathematics-dataset 70%
- instance of ScienceCast 70%
- used by Math-500 70%
- instance of DagsHub 70%
- instance of Math-500 70%
- used by train of thought 70%
- instance of Qwen3-4B 70%
- used by Qwen3-4B 70%
21 天有情绪数据
-
AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难
一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。
-
本地 LLM 测量揭示“思考”和自我批评方面存在问题
运行 Qwen3.5 4B 等本地 LLM 需要仔细测量和验证,因为结果可能不一致。在某些模型中启用“思考”功能,如果超出令牌预算,可能会导致空响应,因此需要读取响应和思考字段或禁用“思考”。自我批评功能并不能可靠地提高准确性,甚至可能降低性能,这凸显了外部、可靠的验证方法的必要性。精确的提示工程,指定确切的输出格式和命名约定,比描述性提示在获得准确结果方面更有效。
-
新的CLEAR框架在不损失效用的情况下增强大语言模型安全性
研究人员开发了CLEAR,一个在不牺牲效用的情况下提高大语言模型安全性的新框架。CLEAR使用一个隐藏状态门来动态调整安全适配器,使其能够减少有害输出,同时保持对良性输入的性能。实验表明,CLEAR在HarmBench等基准测试中显著降低了有害响应率,同时在GSM8K等任务上保持甚至提高了性能,特别是在应用于LLaMA-3-8B-Instruct等模型时。
-
新的LoRA-GA^2算法增强大型模型微调
研究人员推出LoRA-GA^2,这是一种新颖的微调算法,旨在改进现有大型模型的低秩适应(LoRA)方法。这种新方法利用了多步梯度信息(以前的方法未能完全捕捉),以更好地使LoRA更新与完全微调的结果保持一致。LoRA-GA^2包含一个轻量级多步梯度探测器、一个感知频谱的秩分配以及最优初始化,所有这些都不会增加GPU内存使用量。实验结果表明,LoRA-GA^2在GLUE、GSM8K和HumanEval等基准测试中优于其他LoRA变体。
-
新技术可在无共享提示词的情况下将隐藏消息嵌入 LLM 文本
研究人员开发了一种名为同步 Logit 引导 (SLS) 的新型隐写术技术,该技术能够将隐藏消息嵌入大型语言模型生成的自然流畅的文本中。与之前需要发送方和接收方使用相同提示词上下文的方法不同,SLS 从输出本身派生出代理提示词,从而消除了在检索增强生成等生产环境中使用共享提示词的需要。该技术已证明了其实际的隐蔽性和容量,实现了显著的信息密度,并产生了在统计上与标准生成无法区分的输出。
-
新理论解释了验证器不完美如何影响LLM的测试时扩展
一篇题为“ROC-n-reroll:验证器不完美如何影响测试时扩展”的新论文探讨了通过在推理过程中增加计算量来提高语言模型性能的理论基础。研究证明,像Best-of-N和Rejection Sampling这样的方法的准确性直接关系到验证器ROC曲线的几何形状。使用Qwen和Llama模型在GSM8K和MATH500数据集上进行的实验证实,在固定计算量的情况下,Rejection Sampling比Best-of-N更有效,尽管两种方…
-
研究发现自适应 LoRA 秩分配在 RL 训练中失效
一篇新的研究论文表明,自适应秩分配(对于 LoRA (Low-Rank Adaptation) 方法而言)在监督微调 (SFT) 中是有效的,但这种方法并不适用于强化学习 (RL) 环境,例如 Group Relative Policy Optimization (GRPO)。在 Qwen 2.5 1.5B 模型上使用 GSM8K 基准进行测试时,与均匀分配相比,这种自适应方法导致准确率下降了 4.5 个百分点。研究认为,RL 中更平…
-
Qwen3.8-27B FP8 构建显著降低拒绝率,能力影响极小
Qwen3.8-27B 模型已更新为 FP8 构建,将有害指令的拒绝率从 64-99% 大幅降低至 0-6%。然而,这种安全性的提高似乎并未以牺牲能力为代价,因为 MMLU 和 GSM8K 的基准分数变化极小,变动小于 1.3 分。作为红队材料发布的评估数据表明,虽然模型拒绝有害提示的可能性降低,但其核心推理和知识能力基本保持不变。
-
IBM 研究揭示 AI 模型对问题措辞的惊人敏感性
IBM 研究人员推出 BenchDrift,一种评估 AI 模型对问题重述敏感度的方法。该技术在保持答案不变的情况下,在语言、语用和结构轴线上生成基准问题的变体,然后测量正确率的变化。研究结果表明,即使是先进的模型也存在措辞敏感性,在 GSM8K、MMLU 和 MATH-Hard 等基准测试中表现最佳的模型对特定措辞的依赖性最大。
-
Masked diffusion LLMs use EoS tokens for hidden reasoning
研究人员发现,掩码扩散大型语言模型(LLMs)可以利用序列结束(EoS)标记进行隐藏推理,从而提高其在复杂任务上的性能。通过将答案填充到超出正确长度的EoS标记,这些模型似乎利用这些标记的表示作为额外的计算能力。在加法、实体跟踪和数独等任务上使用LLaDA1.5和Dream-v0等模型进行的实验证实,添加EoS标记可以提高准确性。进一步的因果干预,即将EoS标记的隐藏状态转移,增加了反事实答案的可能性,表明这些标记具有潜在的推理能力。
-
AllenAI 教程详细介绍使用 SFT、DPO 和 RLVR 对 Tulu 3 进行后训练
AllenAI 发布了一个教程,详细介绍了如何使用其 Open Instruct 框架对紧凑型指令微调语言模型进行后训练。该过程涉及三个主要阶段:监督微调 (SFT)、直接偏好优化 (DPO) 和使用 GRPO 的可验证奖励强化学习 (RLVR)。该教程通过用轻量级的 Hugging Face 和 PyTorch 实现替换分布式组件,将 Tulu 3 堆栈适配到 16 GB 运行时。它涵盖了数据准备、LoRA 适配器配置以及使用确定性…
-
新研究探索用于自动提示优化的模块化和递归方法
两篇新研究论文介绍了优化大型语言模型提示的新方法。第一篇SAPO将提示分解为角色、上下文和任务等部分,从而进行有针对性的改进,以提高在各种基准测试中的性能。第二篇RLMOpt利用递归语言模型来驱动优化过程本身,从而在多个任务和基准测试中实现更高效、更有效的提示生成,其性能通常优于GEPA等现有方法。
-
新方法通过内部分析解决LLM和VLM的幻觉问题 · 已追踪2个来源
研究人员开发了检测大型语言模型和视觉语言模型中幻觉的新方法。UniProbe是一种用于大型VLM的技术,它使用图神经网络、Vision Transformer和门控循环单元来分析模型内部表示,并在token级别识别幻觉内容。Prompt Embedding Probes (PEP)是另一种方法,它通过可学习的提示嵌入来增强隐藏状态,以检测LLM中的幻觉。这两种方法都旨在提高检测准确性,而无需进行广泛的模型微调。
-
新的 EL-DGR 框架提高了 LLM 裁判在推理管道中的性能
一篇新研究论文介绍了一种用于推理管道中 LLM 裁判的新型决策框架——证据锁定派生-门控-修复 (EL-DGR)。该研究表明,通过限制 LLM 裁判的决策过程,EL-DGR 在 GSM8K 和 HotpotQA 等基准测试中显著提高了性能。该方法通过要求提供提取式证据证明来覆盖共识,而不是仅仅依赖裁判的准确性,从而限制了裁判的潜在错误。
-
Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked
近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…
-
新的老虎机算法通过奖励衰减建模解决LLM优化问题
研究人员开发了一种新的上下文老虎机算法,旨在改进大型语言模型(LLM)的迭代优化。该算法明确地对奖励衰减进行建模,解决了当静态提示或臂被反复使用时发生的过度开发问题。通过使用期望最大化(EM)算法,该方法联合估计臂特定参数和衰减参数,这与传统的线性上置信界(LinUCB)框架不同。在情感反转和GSM8K基准测试上的实验表明,与现有方法相比,性能有了显著提高。
-
新研究解决大语言模型推理、可靠性和可解释性问题
近期研究探索了提高大语言模型(LLMs)推理能力和可靠性的方法。论文引入了行为提升(Behavioral Lift)等新指标来量化推理行为,并识别出放大提升差距(Amplification-Lift Gap),表明训练应侧重于校准和基于事实的推理。其他工作提出了感知-纠正蒸馏(Perception-Correction Distillation)等技术来解决多模态推理中的失败问题,以及 SheetCompass 通过模拟结构关系来增强…
-
LLM JSON 优化在不同模型上效果不一
一项涉及 LLM JSON 字段表示法变更的优化在 Qwen2.5-7B 模型上显示出有希望的结果,提高了在 GSM8K 基准测试上的正确率。然而,这项优化未能转化为 Llama 3.2 3B 模型,降低了其在同一基准测试和可执行工具调用任务上的正确率。研究结果表明,虽然这种表示法的改变可能对某个模型有益,但它们并非普遍适用的优化器,并且代表了对模型的语义干预。
-
G-Boost框架通过LLM协作增强边缘SLM
研究人员开发了G-Boost,一个旨在增强边缘设备上部署的小型语言模型(SLM)性能的新颖框架。该系统实现了资源受限的边缘SLM与基于云的强大大型语言模型(LLM)之间的协作,而无需对边缘模型进行直接参数更新。G-Boost使用一种由奖励模型指导的树搜索方法,动态决定何时仅使用SLM,何时融合SLM和LLM的logits,从而转移领域知识。在GSM8K和MATH-500基准上的评估表明,G-Boost的性能显著优于独立的SLM和其他基…
-
研究审计多智能体LLM中的潜在通信
一项新的研究论文调查了多智能体大型语言模型中潜在通信的有效性,特别是检查了中继键值(KV)缓存的作用。该研究通过用操纵过的版本替换实际缓存来因果审计这些系统,发现当接收方需要发送方的私有信息时,中继缓存会显著提高性能。然而,当不需要私有信息时,性能差异可以忽略不计,这表明观察到的收益并非总是由于真正的“潜在思维”传输。研究还强调,缓存效应的影响可能差异很大,一些方法在缓存清零时显示出显着的性能下降,而另一些方法则对不匹配的缓存表现出最小的影响。