HellaSwag
PulseAugur coverage of HellaSwag — every cluster mentioning HellaSwag across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的VA-DPO方法实现了语言模型可控情感生成
研究人员开发了一种名为VA-DPO的新方法,使语言模型能够生成具有可控情感的文本。与使用离散标签的先前方法不同,VA-DPO将期望的情感指定为效价-唤醒平面中的一个连续点。该方法通过使用一个固定的效价-唤醒回归器来对生成内容进行评分并构建偏好数据,从而修改了直接偏好优化。实验表明,VA-DPO显著减小了与目标情感的距离并提高了相关性,同时没有对MMLU、HellaSwag和TruthfulQA等基准测试的性能产生负面影响。
-
LLM评估指标'acc'与'acc_norm'详解
一项技术性讨论强调了在评估大型语言模型(LLM)时,“acc vs acc_norm”问题,尤其是在多项选择任务中。标准准确率指标(acc)由于依赖于总对数似然,而总对数似然本身会因答案长度而受到惩罚,因此偏向于较短的答案。归一化准确率指标(acc_norm)试图通过将分数除以续写的字节长度来纠正这一点,旨在实现跨模型和分词器的一致性比较。然而,acc_norm也可能引入偏差,例如偏向于将答案拆分成许多可预测的子词的答案。文章建议报告…
-
新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理
研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,…
-
新的FPO方法无需反向传播即可适应LLM,提高吞吐量
研究人员开发了一种名为前向传播仅(FPO)训练的新方法,该方法无需通过模型层进行反向传播即可适应大型语言模型。与标准微调方法相比,该技术实现了显著更高的吞吐量并使用了更少的内存。FPO在域外基准测试中保持了性能,这是全网络微调不总是能复制的特性。该方法依赖于这样一个观察结果:Transformer中后期层的预测误差可以近似真实梯度,从而无需复杂的自动梯度图构建即可将误差信号直接应用于目标层。
-
Transformer注意力中的谱异常值揭示了主导的学习结构
研究人员应用Marchenko-Pastur随机矩阵理论分析了预训练Transformer的注意力权重,识别出代表主导学习结构的谱异常值。通过将Mistral-7B模型中识别出的这些异常值归零,模型在HellaSwag和MMLU等基准测试上的性能显著下降,接近随机猜测水平。对多个Transformer的分析揭示了重复出现的模式,例如Q投影包含最多的异常值,以及特定的残差流维度在各层中形成带状异常值,这表明可能在参数高效微调和结构化剪枝…
-
研究发现:LLM采样变化并不能揭示模型无知
一篇新研究论文发布在arXiv上,探讨了大型语言模型(LLMs)中随机采样的局限性。该研究题为“随机采样在认知上是肤浅的:LLM中温度变化与模型多样性之间的维度鸿沟”,表明单一代言模型多次运行产生的输出变化并不能有效地揭示模型不知道的内容。研究人员使用MMLU、HellaSwag和GSM8K等基准测试,将单一代言模型运行100次与24个LLM模型的一次运行集合进行了比较。他们的发现表明,虽然自我一致性提供了每个问题的模型不确定性,但它…
-
新基准套件评估大语言模型在吉尔吉斯语上的理解能力
研究人员开发了KyrgyzLLM-Bench,这是一个旨在评估大语言模型(LLMs)在吉尔吉斯语上表现的新基准套件。该套件包括了本地创作的数据集,如KyrgyzMMLU和KyrgyzRC,以及已建立基准的翻译版本,如WinoGrande和TruthfulQA。研究评估了26个LLMs,结果显示,对于WinoGrande和BoolQ等任务,模型排名通常会从英语迁移到吉尔吉斯语,但HellaSwag由于翻译的痕迹可能存在显著的性能差距。研…
-
构建生产级 LLM 评估流水线:从感觉走向指标 · 跟踪 8 个来源
这一系列文章详细介绍了为大型语言模型(LLM)构建生产级评估流水线的过程,超越了主观的“感觉检查”,转而实施自动化指标。作者强调了领域特定裁判、CI/CD 集成的速度、回归检测以及健壮的黄金数据集管理的需求。他们提出了一种涉及测试用例、待测 LLM、裁判集合和用于回归检测的指标的架构,并提供了使用 GPT-4o mini 等模型构建自定义 LLM 裁判的示例。
-
Prism Transformer 引入分层注意力的渐进式头调度
研究人员推出 Prism Transformer,这是一种新颖的架构,可修改标准的多头注意力机制。Prism Transformer 不在每个层中为每个注意力头分配相等的维度空间,而是跨层渐进地增加头的数量。这种方法建立了从局部到全局的表示层次结构,使早期层能够用更宽的头捕获复杂的局部模式,而更深的层则用更窄的头进行专业化。该架构是参数中性的,不会引入额外的训练或推理开销,但在下游零样本基准测试中始终优于统一基线。
-
新方法通过自适应解码策略提高 LLM 推理速度
研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。
-
通用大语言模型在基准测试中已超越专业临床AI,但安全担忧依然存在
通用大语言模型在包括结构化知识和推理在内的各种基准测试中,其性能水平已达到或超过专业临床AI系统。例如,DeepSeek R1等模型在创伤性牙损伤(TDI)基准测试中表现出高准确率,可与专家决策树相媲美。然而,尽管在基准测试中取得了成功,但由于工作流程整合、患者安全和监管障碍等方面的担忧,其在医疗保健领域的广泛应用仍然受限。虽然通用大语言模型提供了强大的功能,但其部署需要仔细考虑其局限性,例如潜在的幻觉和脆弱的判断力,因此必须采取健全…
-
新的量化感知训练方法实现近乎无损的大模型性能
研究人员开发了一种新的大语言模型(LLM)量化感知训练(QAT)方法,称为Max-Window Scale Estimation。该技术解决了两种失效模式:amax饱和(延迟的尺度估计会破坏表示)和灾难性遗忘(激进的学习率会抹去预训练知识)。通过采用保守的DTS策略和BF16预热,该方法显著降低了在MMLU和HellaSwag等基准测试上的性能下降,实现了近乎无损的结果,且训练损失偏差极小。
-
新的QUIET基准客观衡量大型语言模型的创意写作能力
研究人员推出了一项名为QUIET的新基准,旨在评估大型语言模型的创意生成能力。与依赖多项选择格式或主观人工评分的现有基准不同,QUIET采用多空白级联故事填空方法,具有明确的内容约束和空白间的依赖关系。这种方法允许基于“校准惊喜”框架进行客观、自动化的评分,该框架奖励符合约束且富有创意的响应。
-
LLM 基准测试成本分析:3 项任务花费 0.12 美元
在单个 T4 GPU 上对三项大型语言模型任务(GSM8K、HellaSwag 和 TruthfulQA)进行基准测试,成本约为 0.12 美元。分析显示,生成任务是主要的成本驱动因素,而对数似然任务可以并行处理。通过将 token 限制在 256 个、使用 25% 的分层样本以及采用 MC2 评分进行优化,可以显著降低运行时间和成本。
-
使用Qwen2.5-0.5B评估LLM的成本低于1美元
这篇博文详细介绍了一种经济高效的评估大型语言模型的方法,证明了运行全面的基准测试的成本可以低于一美元。作者使用免费的Google Colab T4实例在三个不同的任务上测试了Qwen2.5-0.5B模型:GSM8K用于数学推理,HellaSwag用于常识,TruthfulQA-MC2用于真实性。实验重点是测量运行时间和成本,利用lm-evaluation-harness并进行特定调整以优化性能和降低费用,例如限制生成令牌的长度。
-
Aurora 优化器提升神经网络训练效率
研究人员推出 Aurora,这是一种旨在改进大型神经网络训练的新优化器,特别适用于具有矩形矩阵的神经网络。Aurora 解决了现有优化器(如 Muon)在 MLP 层中可能出现的神经元死亡问题,尤其是在应用行归一化时。通过结合感知杠杆率和保持正交性,Aurora 展现出显著的数据效率,在开源互联网数据上实现了 100 倍的提升,并在通用评估中超越了更大的模型。该优化器被呈现为一个几乎没有开销的即插即用替代品,并且其代码已开源。