PulseAugur
中
实时 13:26:29
实体 HellaSwag

HellaSwag

PulseAugur coverage of HellaSwag — every cluster mentioning HellaSwag across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_286986 ·

    新的AWT方法通过激活感知张量化增强LLM压缩

    研究人员开发了一种名为激活感知权重张量化(AWT)的新方法,利用张量网络技术来改进大型语言模型的压缩。AWT作为一种校准时包装器,在应用标准的张量网络分解之前,根据激活分布对权重矩阵进行预处理。这种方法通过减小困惑度差距和提高下游任务性能,在Llama 3.1 8B、Mistral 8B和Qwen2.5 7B等各种模型上一致地增强了张量化方法(如张量链TT和树张量网络TTN)的性能。

  2. TOOL · CL_275046 ·

    新的TRACE方法增强了LLM在多轮有害请求方面的安全性

    研究人员开发了一种名为TRACE(Trajectory Return Attribution and Contrastive Erasure)的新方法,以提高大型语言模型(LLM)的安全性。该技术解决了LLM可能被诱骗生成有害内容的问题,即使它们拒绝单轮有害提示,也可以通过将请求分散到多轮来诱骗它们。TRACE通过分配一个令牌级目标来实现这一点,该目标根据拒绝可归因优势的折扣回报来加权令牌,从而使早期令牌能够因后期的拒绝证据而获得信用…

  3. FRONTIER RELEASE · CL_270510 ·

    TypeSafe AI的Jev模型在决策任务上优于开源替代品 · 跟踪4个来源

    TypeSafe AI发布了Jev,一个“System One”模型,旨在做出小型、具体的决策,而不是生成文本。Jev从固定集合中返回选择、评分或校准的概率,旨在提高信息访问管道的效率。独立评估显示,Jev在各种基准测试中显著优于Qwen和Gemma等开源模型,尤其是在准确性和概率校准方面,尽管它仍然容易受到提示注入的影响,并且在低资源语言上表现下降。此次发布引发了一波开源重写,虽然提供了更低的延迟和成本,但总体上未能达到Jev的开箱即用准确性。

  4. TOOL · CL_235505 ·

    LLM基准测试污染推高分数但很少重排排行榜

    arXiv上的一篇新论文研究了大型语言模型中的基准测试污染,区分了分数膨胀和排行榜重排。研究发现,虽然污染确实会推高绝对分数,但很少改变模型在排行榜上的排名。该研究提出了一种通过比较原始测试项目和释义版本来审计污染的方法,并建议排行榜应报告释义控制的排名以及置信区间。

  5. TOOL · CL_228998 ·

    新的ROSI技术无需微调即可增强LLM安全对齐

    研究人员开发了一种名为秩一安全注入(ROSI)的新技术,以增强大型语言模型(LLM)的安全对齐。ROSI是一种无需微调的方法,通过应用秩一权重修改,永久地将模型的内部激活引导至一个拒绝中介子空间。该方法已被Llama Guard 3评估证明提高了安全拒绝率,同时不影响模型在MMLU和HellaSwag等标准基准上的效用。ROSI也可用于重新对齐“未审查”的模型,作为最后一英里安全程序被证明有效。

  6. TOOL · CL_223506 ·

    VIDRAFT发布小型AI模型评测框架,登顶Hugging Face前十

    韩国AI初创公司VIDRAFT (지니젠AI) 发布了一个专门用于评估小型语言模型(SLM)的框架。该框架及其相关数据集同时登上了Hugging Face Spaces和Datasets排行榜的前十名。该工具旨在提供一种更准确的方法来对紧凑型AI模型进行基准测试和区分,填补了现有基准测试通常为大型架构设计的空白。

  7. TOOL · CL_217837 ·

    研究发现LLM排行榜因配置脆弱项而产生偏差

    arXiv上的一篇新论文揭示,现代大型语言模型(LLM)排行榜受到“配置脆弱”项的显著影响,这意味着问题的呈现方式和答案的评估方式会极大地改变模型的感知性能。研究人员通过在3,679个基准项上测试12个LLM的26种不同配置,创建了一个“脆弱性网格”。研究发现,与选项顺序相比,评分方法是影响最大的关键因素,某些模型在特定配置下能获得最高排名,而其他模型的分数差异高达58个百分点。这表明,由于对评估设置的敏感性,当前的排行榜可能无法准确…

  8. TOOL · CL_215931 ·

    新的VA-DPO方法实现了语言模型可控情感生成

    研究人员开发了一种名为VA-DPO的新方法,使语言模型能够生成具有可控情感的文本。与使用离散标签的先前方法不同,VA-DPO将期望的情感指定为效价-唤醒平面中的一个连续点。该方法通过使用一个固定的效价-唤醒回归器来对生成内容进行评分并构建偏好数据,从而修改了直接偏好优化。实验表明,VA-DPO显著减小了与目标情感的距离并提高了相关性,同时没有对MMLU、HellaSwag和TruthfulQA等基准测试的性能产生负面影响。

  9. TOOL · CL_211295 ·

    LLM评估指标'acc'与'acc_norm'详解

    一项技术性讨论强调了在评估大型语言模型(LLM)时,“acc vs acc_norm”问题,尤其是在多项选择任务中。标准准确率指标(acc)由于依赖于总对数似然,而总对数似然本身会因答案长度而受到惩罚,因此偏向于较短的答案。归一化准确率指标(acc_norm)试图通过将分数除以续写的字节长度来纠正这一点,旨在实现跨模型和分词器的一致性比较。然而,acc_norm也可能引入偏差,例如偏向于将答案拆分成许多可预测的子词的答案。文章建议报告…

  10. TOOL · CL_216305 ·

    新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理

    研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,…

  11. TOOL · CL_206021 ·

    新的FPO方法无需反向传播即可适应LLM,提高吞吐量

    研究人员开发了一种名为前向传播仅(FPO)训练的新方法,该方法无需通过模型层进行反向传播即可适应大型语言模型。与标准微调方法相比,该技术实现了显著更高的吞吐量并使用了更少的内存。FPO在域外基准测试中保持了性能,这是全网络微调不总是能复制的特性。该方法依赖于这样一个观察结果:Transformer中后期层的预测误差可以近似真实梯度,从而无需复杂的自动梯度图构建即可将误差信号直接应用于目标层。

  12. TOOL · CL_193460 ·

    Transformer注意力中的谱异常值揭示了主导的学习结构

    研究人员应用Marchenko-Pastur随机矩阵理论分析了预训练Transformer的注意力权重,识别出代表主导学习结构的谱异常值。通过将Mistral-7B模型中识别出的这些异常值归零,模型在HellaSwag和MMLU等基准测试上的性能显著下降,接近随机猜测水平。对多个Transformer的分析揭示了重复出现的模式,例如Q投影包含最多的异常值,以及特定的残差流维度在各层中形成带状异常值,这表明可能在参数高效微调和结构化剪枝…

  13. TOOL · CL_160645 ·

    研究发现:LLM采样变化并不能揭示模型无知

    一篇新研究论文发布在arXiv上,探讨了大型语言模型(LLMs)中随机采样的局限性。该研究题为“随机采样在认知上是肤浅的:LLM中温度变化与模型多样性之间的维度鸿沟”,表明单一代言模型多次运行产生的输出变化并不能有效地揭示模型不知道的内容。研究人员使用MMLU、HellaSwag和GSM8K等基准测试,将单一代言模型运行100次与24个LLM模型的一次运行集合进行了比较。他们的发现表明,虽然自我一致性提供了每个问题的模型不确定性,但它…

  14. TOOL · CL_154354 ·

    新基准套件评估大语言模型在吉尔吉斯语上的理解能力

    研究人员开发了KyrgyzLLM-Bench,这是一个旨在评估大语言模型(LLMs)在吉尔吉斯语上表现的新基准套件。该套件包括了本地创作的数据集,如KyrgyzMMLU和KyrgyzRC,以及已建立基准的翻译版本,如WinoGrande和TruthfulQA。研究评估了26个LLMs,结果显示,对于WinoGrande和BoolQ等任务,模型排名通常会从英语迁移到吉尔吉斯语,但HellaSwag由于翻译的痕迹可能存在显著的性能差距。研…

  15. TOOL · CL_150490 ·

    构建生产级 LLM 评估流水线:从感觉走向指标 · 跟踪 8 个来源

    这一系列文章详细介绍了为大型语言模型(LLM)构建生产级评估流水线的过程,超越了主观的“感觉检查”,转而实施自动化指标。作者强调了领域特定裁判、CI/CD 集成的速度、回归检测以及健壮的黄金数据集管理的需求。他们提出了一种涉及测试用例、待测 LLM、裁判集合和用于回归检测的指标的架构,并提供了使用 GPT-4o mini 等模型构建自定义 LLM 裁判的示例。

  16. TOOL · CL_115691 ·

    Prism Transformer 引入分层注意力的渐进式头调度

    研究人员推出 Prism Transformer,这是一种新颖的架构,可修改标准的多头注意力机制。Prism Transformer 不在每个层中为每个注意力头分配相等的维度空间,而是跨层渐进地增加头的数量。这种方法建立了从局部到全局的表示层次结构,使早期层能够用更宽的头捕获复杂的局部模式,而更深的层则用更窄的头进行专业化。该架构是参数中性的,不会引入额外的训练或推理开销,但在下游零样本基准测试中始终优于统一基线。

  17. RESEARCH · CL_115628 ·

    新方法通过自适应解码策略提高 LLM 推理速度

    研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。

  18. TOOL · CL_102459 ·

    通用大语言模型在基准测试中已超越专业临床AI,但安全担忧依然存在

    通用大语言模型在包括结构化知识和推理在内的各种基准测试中,其性能水平已达到或超过专业临床AI系统。例如,DeepSeek R1等模型在创伤性牙损伤(TDI)基准测试中表现出高准确率,可与专家决策树相媲美。然而,尽管在基准测试中取得了成功,但由于工作流程整合、患者安全和监管障碍等方面的担忧,其在医疗保健领域的广泛应用仍然受限。虽然通用大语言模型提供了强大的功能,但其部署需要仔细考虑其局限性,例如潜在的幻觉和脆弱的判断力,因此必须采取健全…

  19. TOOL · CL_53675 ·

    新的量化感知训练方法实现近乎无损的大模型性能

    研究人员开发了一种新的大语言模型(LLM)量化感知训练(QAT)方法,称为Max-Window Scale Estimation。该技术解决了两种失效模式:amax饱和(延迟的尺度估计会破坏表示)和灾难性遗忘(激进的学习率会抹去预训练知识)。通过采用保守的DTS策略和BF16预热,该方法显著降低了在MMLU和HellaSwag等基准测试上的性能下降,实现了近乎无损的结果,且训练损失偏差极小。

  20. RESEARCH · CL_50617 ·

    新的QUIET基准客观衡量大型语言模型的创意写作能力

    研究人员推出了一项名为QUIET的新基准,旨在评估大型语言模型的创意生成能力。与依赖多项选择格式或主观人工评分的现有基准不同,QUIET采用多空白级联故事填空方法,具有明确的内容约束和空白间的依赖关系。这种方法允许基于“校准惊喜”框架进行客观、自动化的评分,该框架奖励符合约束且富有创意的响应。