Massive Multitask Language Understanding
PulseAugur coverage of Massive Multitask Language Understanding — every cluster mentioning Massive Multitask Language Understanding across labs, papers, and developer communities, ranked by signal.
- instance of large-language models 90%
- instance of HumanEval 90%
- instance of ScienceCast 90%
- instance of DagsHub 90%
- instance of Gotit.pub 90%
- instance of Pythia 90%
- instance of GSM8K 70%
- used by HumanEval 70%
- used by HellaSwag 70%
- instance of HellaSwag 70%
- used by llama 70%
- used by large-language models 70%
13 天有情绪数据
-
新的TACD方法可跨语言检测LLM数据污染
研究人员开发了一种名为“翻译感知污染检测”(TACD)的新方法,用于识别大型语言模型中的数据污染,特别是当污染发生在与评估基准不同的语言时。研究发现,传统的仅限英语的探测方法在模型接触到MMLU和XQuAD等评估数据集的阿拉伯语翻译时,无法有效检测到污染。TACD依赖于跨语言预测一致性,在识别此类污染方面显示出潜力,尽管其有效性因模型而异。
-
新的RASA框架增强了专家混合模型的安全对齐
研究人员开发了RASA,一个用于将专家混合(MoE)语言模型与安全协议对齐的新框架。与微调所有参数的传统方法不同,RASA针对MoE架构中的特定“安全关键专家”。这种方法可以防止通过模型的路由机制绕过安全协议,并在针对各种越狱攻击时表现出近乎完美的鲁棒性。RASA在保持通用能力基准测试性能的同时,也显著降低了过度拒绝率。
-
新的PatchBench基准揭示了LLM安全修复中的附带损害
一个名为PatchBench的新基准已被开发出来,用于评估大型语言模型(LLM)中安全补丁的有效性。该基准旨在识别补丁可能修复了特定的有害行为,但却无意中导致其他方面出现回归的情况,例如拒绝良性提示或在略微修改的有害提示上失败。PatchBench包含一组精心策划的400个高置信度越狱失败案例,以及一个名为PatchBench-Local的评估协议,该协议旨在通过检查原始提示的有害变体和良性邻近提示来测试行为的精确性。使用PatchB…
-
新的 PiERN 架构将精确计算与大型语言模型相结合
研究人员开发了一种名为 Physically-isolated Experts Routing Network (PiERN) 的新架构,旨在将高精度数值计算与大型语言模型集成。PiERN 能够在单一的思维链中迭代地交替进行计算和推理,从而提高复杂任务的准确性和效率。在 PDEBench 和电池管理任务等基准测试上的评估表明,PiERN 在准确性、延迟、令牌使用和能耗方面优于直接微调的大型语言模型,同时在 MMLU 和 GLUE 等标…
-
LLM基准测试平均方法存在缺陷,偏袒测试次数少的模型
最近对LLM基准测试排行榜的分析揭示了平均方法论的缺陷,尤其是在模型在不同数量的基准测试上进行测试时。最初的方法是将归一化分数跨类别平均,无意中偏袒了在较少、较容易的基准测试中取得结果的模型,而不是那些在更具挑战性的评估中进行了广泛测试的模型。这导致了数据有限的模型优于结果全面的模型,凸显了需要更稳健的方法来准确评估LLM的能力。
-
新的TRACE方法增强了LLM在多轮有害请求方面的安全性
研究人员开发了一种名为TRACE(Trajectory Return Attribution and Contrastive Erasure)的新方法,以提高大型语言模型(LLM)的安全性。该技术解决了LLM可能被诱骗生成有害内容的问题,即使它们拒绝单轮有害提示,也可以通过将请求分散到多轮来诱骗它们。TRACE通过分配一个令牌级目标来实现这一点,该目标根据拒绝可归因优势的折扣回报来加权令牌,从而使早期令牌能够因后期的拒绝证据而获得信用…
-
MIRROR 原始机制可防御针对 LLM 多智能体通信的攻击 · 已追踪 2 个来源
研究人员推出了一种新颖的通信层完整性原始机制 MIRROR,旨在保护大型语言模型多智能体系统 (LLM-MAS) 免受中间人攻击 (AiTM)。MIRROR 将消息复制到多个逻辑路径,仅当严格多数路径报告相同的摘要时才接受消息,从而防止传输中的消息被篡改。在跨各种基准和框架的测试中,此方法有效地将攻击成功率降至 0%,同时与 LLM-as-a-Judge 等替代方法相比,计算成本极低。
-
新研究质疑角色扮演在LLM中的有效性,提出MLCP策略
一篇新的研究论文探讨了角色扮演提示在大型语言模型(LLM)中的有效性,发现性能提升高度依赖于模型的容量、知识领域和提示的语言。该研究提出了与角色相关的认知对齐假设,认为角色扮演仅在LLM准确理解角色及其相关知识时才有效。为提高一致性,该论文引入了混合语言连接预测(MLCP),这是一种无需训练的提示连接策略,通过聚合语义等价的提示来增强表征线索,在各种LLM上展示了优于标准角色扮演的性能。
-
新研究探索具有刚体力学和权重分析的 Transformer 架构 · 跟踪 5 个来源
研究人员正在探索通过整合刚体力学和分析权重结构来增强 Transformer 架构的新方法。一篇论文介绍了“Screw Attention”,这是一种 Transformer 层,它使用刚体代数对物体之间的空间关系进行建模,在操作任务和几何变化鲁棒性方面表现出改进的性能。另一项研究“JET: Justification Evaluation in Transformer”专注于提高 Transformer 在 MMLU 等任务中的决策…
-
TypeSafe AI的Jev模型在决策任务上优于开源替代品 · 跟踪4个来源
TypeSafe AI发布了Jev,一个“System One”模型,旨在做出小型、具体的决策,而不是生成文本。Jev从固定集合中返回选择、评分或校准的概率,旨在提高信息访问管道的效率。独立评估显示,Jev在各种基准测试中显著优于Qwen和Gemma等开源模型,尤其是在准确性和概率校准方面,尽管它仍然容易受到提示注入的影响,并且在低资源语言上表现下降。此次发布引发了一波开源重写,虽然提供了更低的延迟和成本,但总体上未能达到Jev的开箱即用准确性。
-
Tetra LLM 量化实现每参数 2.7 比特,提升推理速度
研究人员开发了 Tetra,一种将大语言模型(LLM)量化至平均每参数 2.7 比特的新颖方法,显著降低了内存需求。该技术基于 leech-lattice 量化,通过优化码本结构并采用专门的内核来最小化 GPU 内存加载的数据,从而实现这一目标。使用 Tetra 量化的模型,如 Qwen3 变体,在 MMLU 和 GSM8K 等基准测试中表现出与更高比特量化方法相当的性能,仅有轻微下降,同时在推理速度方面显示出显著提升。
-
新研究探索跨不同硬件和架构的高效 LLM 推理技术 · 跟踪 10 个来源
多篇研究论文探索了优化大型语言模型 (LLM) 推理的新颖方法,重点关注效率和可访问性。CoMoE 和 Cascadia 旨在通过提高通信效率和驻留执行,在普通硬件上实现专家混合 (MoE) 模型。SchemaFill 和 BitNest 引入了投机解码技术,以加速 LLM 工具调用并减少内存开销。DySCo 和 EdgeAgent 通过优化 KV 缓存管理和统一内存架构上的动态调度,来解决边缘-云协同推理和多代理系统问题。最后,To…
-
新的 ARIA 方法在不修改权重的情况下遗忘 LLM 知识
研究人员开发了 ARIA(autoencoder-gated inference-time unlearning,自动编码器门控推理时遗忘),一种在不改变大型语言模型核心权重的情况下移除特定知识的新颖方法。与传统的权重修改方法不同,ARIA 在推理时运行,使用在稀疏自编码器潜在空间上训练的轻量级检测器来干预不希望的知识被访问。这种方法旨在减轻遗忘-效用权衡,并提高对遗忘后攻击的鲁棒性。在 TOFU、R-TOFU 和 WMDP 等基准测…
-
语言模型的置信信号不一致,影响可靠性评估
一篇新的研究论文探讨了自回归语言模型中局部置信信号和全局置信信号之间的区别。研究发现,这两个度量——一个来自贪婪选择的答案标记的概率,另一个来自重复抽样的答案频率——之间的相关性很弱,并且与正确性的关联也不同。全局置信度与准确性之间存在中度关联,而局部置信度几乎没有相关性。研究还表明,这些置信信号之间的不一致可能预示着模型抽样不稳定,尤其是在 ARC 挑战等基准测试上。
-
新模型使用历史数据而非自我评估来预测LLM的准确性
研究人员开发了广义正确性模型(GCMs),它们可以通过学习历史预测模式来预测大型语言模型(LLM)的准确性,而不是依赖LLM的自我评估。这些GCMs展示了一种可泛化且与模型无关的LLM置信度估计技能,在不同的数据集和模型家族中表现良好。研究发现,答案措辞是正确性的重要预测因素,并探索了诸如上下文内示例和事后校准等方法来提高预测准确性。
-
新的LLM-Microscope工具揭示了标点符号在Transformer上下文中的隐藏作用
研究人员开发了LLM-Microscope,这是一个用于分析大型语言模型如何处理和保留上下文信息的工具包。该工具显示,标点符号和限定词等看似微小的标记在维持上下文方面起着至关重要的作用,移除它们会显著影响MMLU和BABILong-4k等基准测试的性能。研究结果还强调了模型嵌入中的上下文化与线性度之间的强相关性,表明这些不太显眼的标记对于Transformer中的长距离理解至关重要。
-
开源多模态模型在成本和性能上挑战 GPT-4o · 跟踪 2 个来源
开源多模态模型在性能和成本效益方面正迅速追赶 GPT-4o,其中阿里巴巴的 Qwen2.5-VL 和 Mistral 的 Pixtral 12B 等模型在文档处理和视觉问答等任务上提供了竞争性的能力。虽然 GPT-4o 在复杂跨模态推理和细微指令遵循方面仍处于领先地位,但开源替代方案在部署灵活性和更低的推理成本方面具有显著优势,使其对许多生产用例具有吸引力。OpenAI 最近的 GPT-4o 更新改进了其原生图像和音频推理能力,降低了…
-
新的EAR方法优化了RAG问答的检索
研究人员开发了一种实体感知分区(EAR)方法,以改进用于多项选择问答的检索增强生成(RAG)。EAR侧重于从问题和答案中提取规范化的锚点,以从语料库中检索更相关、更小的片段,与固定大小的块相比,检索词减少高达40.2%。虽然在Mistral、Gemma和DeepSeek模型的测试中,EAR并未带来统计学上显著的准确性提升,但它提供了一个更紧凑、更易于检查的检索单元。
-
MMLU基准审计揭示侧重检索而非推理
一项对大规模多任务语言理解 (MMLU) 基准的新审计显示,其总分主要衡量事实检索能力而非推理能力。研究人员使用项目反应理论分析了 1,000 个语言模型中的 14,042 个 MMLU 测试项目,发现该基准混淆了不同的概念,并且 STEM 和非 STEM 分区之间的难度差异很大。这种不平衡无意中偏袒了针对检索进行优化的模型,可能误导了推理密集型任务的模型选择。
-
LLM基准测试污染推高分数但很少重排排行榜
arXiv上的一篇新论文研究了大型语言模型中的基准测试污染,区分了分数膨胀和排行榜重排。研究发现,虽然污染确实会推高绝对分数,但很少改变模型在排行榜上的排名。该研究提出了一种通过比较原始测试项目和释义版本来审计污染的方法,并建议排行榜应报告释义控制的排名以及置信区间。