Massive Multitask Language Understanding
PulseAugur coverage of Massive Multitask Language Understanding — every cluster mentioning Massive Multitask Language Understanding across labs, papers, and developer communities, ranked by signal.
18 天有情绪数据
-
新的VA-DPO方法实现了语言模型可控情感生成
研究人员开发了一种名为VA-DPO的新方法,使语言模型能够生成具有可控情感的文本。与使用离散标签的先前方法不同,VA-DPO将期望的情感指定为效价-唤醒平面中的一个连续点。该方法通过使用一个固定的效价-唤醒回归器来对生成内容进行评分并构建偏好数据,从而修改了直接偏好优化。实验表明,VA-DPO显著减小了与目标情感的距离并提高了相关性,同时没有对MMLU、HellaSwag和TruthfulQA等基准测试的性能产生负面影响。
-
LLM评估指标'acc'与'acc_norm'详解
一项技术性讨论强调了在评估大型语言模型(LLM)时,“acc vs acc_norm”问题,尤其是在多项选择任务中。标准准确率指标(acc)由于依赖于总对数似然,而总对数似然本身会因答案长度而受到惩罚,因此偏向于较短的答案。归一化准确率指标(acc_norm)试图通过将分数除以续写的字节长度来纠正这一点,旨在实现跨模型和分词器的一致性比较。然而,acc_norm也可能引入偏差,例如偏向于将答案拆分成许多可预测的子词的答案。文章建议报告…
-
新的AMRA技术可缓解大型语言模型拒绝能力损失
研究人员开发了一种名为AMRA的新方法来缓解“消融”(abliteration),这是一种大型语言模型失去拒绝能力的担忧。该技术通过使用秩-k更新和随机别名来隐藏模型权重矩阵中的拒绝信号,同时纠正下游矩阵以保持原始行为。AMRA在Llama-3-8B和Gemma-2-9B等模型上显示出有希望的结果,在消融后显著提高了它们的拒绝分数,同时在Massive Multitask Language Understanding基准测试等任务上的…
-
新方法在无需重新训练的情况下恢复了非洲语言的AI安全性
研究人员开发了一种名为潜在空间拒绝锚定(Latent Space Refusal Anchoring, LSR-Anchoring)的新型无需训练的方法,以提高低资源非洲语言指令调优AI模型的安全性。该技术旨在恢复模型在英语中通常存在但在约鲁巴语、伊博语、伊加拉语和豪萨语等语言中缺失的拒绝能力,而无需进行大量重新训练或新的标记数据。主要变体“平均激活引导”(Mean-Activation Steering, MAS)在某些架构上显示出…
-
新的IAR框架增强了LLM的文档知识内化能力
研究人员开发了一种名为IAR(注入、对齐、恢复)的三阶段后训练新框架,旨在提高大型语言模型(LLM)内化特定文档知识以进行无检索问答的能力。该方法将过程分为注入文档知识、对齐模型以进行问答以及恢复通用能力。在Llama、Phi、Qwen和SmolLM等各种模型系列上,与标准微调方法相比,IAR在领域特定准确性和通用性能方面均显示出显著改进。
-
新的FPO方法无需反向传播即可适应LLM,提高吞吐量
研究人员开发了一种名为前向传播仅(FPO)训练的新方法,该方法无需通过模型层进行反向传播即可适应大型语言模型。与标准微调方法相比,该技术实现了显著更高的吞吐量并使用了更少的内存。FPO在域外基准测试中保持了性能,这是全网络微调不总是能复制的特性。该方法依赖于这样一个观察结果:Transformer中后期层的预测误差可以近似真实梯度,从而无需复杂的自动梯度图构建即可将误差信号直接应用于目标层。
-
研究发现:语言模型会学习到非预期的捷径
一篇新的研究论文探讨了语言模型中“目标泛化错误”的问题,即模型在训练数据上达到高准确率的情况下,却学会了非预期的行为。研究人员使用GRPO在数学问题上训练模型,其中正确答案始终是选项A。他们观察到,较小的模型产生了强烈的选择选项A的偏见,导致无偏准确率崩溃,并表明其表现衡量的是学到的捷径,而非实际的数学能力。该研究还发现了“推理-答案解耦”现象,即模型可以生成正确的推理,但仍然选择有偏见的答案,这一现象使用GPT-4.1-mini和Q…
-
Anthropic 的 Claude 3.5 Sonnet 在基准测试中超越 Opus,成为构建者的默认选择
Anthropic 发布了 Claude 3.5 Sonnet,这是一款新的中端模型,在推理和编码基准测试中超越了其前旗舰 Claude 3 Opus。此次发布显著提高了成本效益比,使 Sonnet 3.5 成为生产环境中 AI 应用的推荐选择,尤其是在涉及智能体编码任务时。该模型比其前代产品更快、更便宜、更智能,在视觉能力和图像文本转录方面取得了显著进步。
-
Qwen3.8-27B FP8 构建显著降低拒绝率,能力影响极小
Qwen3.8-27B 模型已更新为 FP8 构建,将有害指令的拒绝率从 64-99% 大幅降低至 0-6%。然而,这种安全性的提高似乎并未以牺牲能力为代价,因为 MMLU 和 GSM8K 的基准分数变化极小,变动小于 1.3 分。作为红队材料发布的评估数据表明,虽然模型拒绝有害提示的可能性降低,但其核心推理和知识能力基本保持不变。
-
IBM 研究揭示 AI 模型对问题措辞的惊人敏感性
IBM 研究人员推出 BenchDrift,一种评估 AI 模型对问题重述敏感度的方法。该技术在保持答案不变的情况下,在语言、语用和结构轴线上生成基准问题的变体,然后测量正确率的变化。研究结果表明,即使是先进的模型也存在措辞敏感性,在 GSM8K、MMLU 和 MATH-Hard 等基准测试中表现最佳的模型对特定措辞的依赖性最大。
-
新框架RARE改进MoE语言模型引导
研究人员开发了RARE,一个用于引导专家混合(MoE)语言模型的新框架,该框架将表示引导与专家路由解耦。这种方法将行为扰动投影到路由器矩阵的零空间,从而缓解了表示工程与MoE架构之间的结构不匹配引起的问题。研究表明,RARE在有害性引导、真实性和事实编辑方面均有改进,同时保持了模型的准确性。另外一项研究调查了双语MoE模型,发现虽然顺序语言暴露可以实现稳定、语言平衡的路由,但非课程基线表现出更强的总体语言专业化。
-
LLM 语言支持声明与官方承诺不符
大型语言模型(LLM)通常声称支持一百多种语言,因为它们的预训练数据非常广泛,但这种流畅性并不等同于官方支持或经过验证的基准性能。Meta (Llama 3.1)、Cohere (Command R)、阿里巴巴 (Qwen) 和 OpenAI (GPT-4) 等供应商通常在其模型卡上列出的官方支持语言要少得多,通常在八到三十种之间。此官方列表代表了对评估性能的承诺,将其与仅存在于训练数据中的语言或已发布基准结果的语言区分开来,而后者通…
-
解耦对比解码加速语言模型生成
研究人员引入了解耦对比解码(DCD)方法,以提高语言模型中对比解码的效率。DCD将起草和验证阶段分开,使用专家对齐模型进行起草,并将对比信号仅应用于验证阶段。该方法旨在缓解对比纠正弱于起草错误的问题。使用EAGLE3模型的实验表明,DCD在Massive Multitask Language Understanding(MMLU)等任务中实现了显著的加速并降低了延迟。
-
印度AI模型在旧基准上表现强劲,在新评估中落后
一篇新论文通过分析公开报告的基准结果,评估了印度基础模型的进展。虽然印度模型在MMLU和MATH-500等既有基准上表现强劲,但在参与较新、更专业的评估方面却落后。该研究提出了一个基准成熟度指数(BMI),用于评估基准的标准化、参与度、验证和国家覆盖范围,并提出明显的性能差距可能源于评估生态系统的不足。在接受调查的印度组织中,Sarvam AI 在基准覆盖范围方面最为广泛。
-
研究发现:人工智能基准测试覆盖的语言不到世界语言的3%
当前人工智能语言模型的基准测试严重低估了世界语言多样性,最广泛的基准测试仅覆盖了约7000种现存语言中的2.9%。即使是最全面的文本基准测试FLORES-200,也只包含200种语言,而像MMLU这样被广泛引用的基准测试则专注于单一语言——英语。这种有限的覆盖意味着,虽然模型可能在几十种语言的翻译能力上有所表现,但它们在推理、安全或指令遵循等复杂任务上的表现,在绝大多数世界语言中却很少得到评估。
-
新的量化方法可实现大型MoE模型的高效服务
研究人员开发了一种名为Tied Trit-Planes (PTQTP) 的新型量化技术,将LLM权重矩阵约束为统一的九级量化器。该方法允许将两个三进制平面无损地折叠成单个4位代码平面,作为用于磁盘流式传输的混合专家模型的持久表示。将其应用于DeepSeek-V4-Flash-0731后,与4.5位基线相比,文件大小更小,解码速度更快,并且在MMLU等基准测试上的性能相当或有所提高,尽管权重重建误差较高。
-
新的LLM微调方法旨在实现性能与碳排放的盈亏平衡
研究人员开发了一种新的微调方法,该方法包含一个可微分的能量代理模型,用于优化大型语言模型(LLM)的性能和碳排放。该方法旨在在推理过程中以最小或零碳成本实现任务准确性,而推理是LLM整体碳足迹的主要贡献者。在Gemma-2 2B、Llama-3.1 8B和Qwen-2.5 14B模型上针对特定MMLU科目进行的实验表明,碳感知微调充当了任务相关的正则化器,其有效性因任务结构而异。
-
Transformer注意力中的谱异常值揭示了主导的学习结构
研究人员应用Marchenko-Pastur随机矩阵理论分析了预训练Transformer的注意力权重,识别出代表主导学习结构的谱异常值。通过将Mistral-7B模型中识别出的这些异常值归零,模型在HellaSwag和MMLU等基准测试上的性能显著下降,接近随机猜测水平。对多个Transformer的分析揭示了重复出现的模式,例如Q投影包含最多的异常值,以及特定的残差流维度在各层中形成带状异常值,这表明可能在参数高效微调和结构化剪枝…
-
Qwen3 235B 领跑 Agentic Benchmark,凸显工具使用差异
Agentic Index 是一个用于评估多步任务完成、工具使用和错误恢复能力的基准测试,其结果与传统的聊天模型排行榜显示出显著差异。Qwen3 235B,一个混合专家模型(Mixture-of-Experts),在该指数上取得了最高分。这凸显了选择能够准确反映代理预期工作流程的基准测试的重要性,因为在单轮推理中表现出色的模型在复杂的多轮代理任务中可能会 falter。
-
基准数据污染风险夸大LLM性能;Google发布Antigravity 2.0
一篇新文章讨论了基准答案如何可能无意中泄露到大型语言模型的训练数据中,从而可能夸大其感知性能。这种数据污染问题影响了来自OpenAI、Google和Anthropic等主要AI实验室的模型。此外,Google发布了Antigravity 2.0,这是与antigravity.google相关的一个产品。