PulseAugur
实时 10:00:05
English(EN) HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

新的基准数据集揭示前沿大型语言模型中的隐藏风险

研究人员推出 HarmProfile,这是一个新基准数据集,旨在刻画前沿大型语言模型 (LLM) 的有害输出。该数据集包含来自 13 个系列、23 个 LLM 的超过 80,000 个已验证的制品,分为 15 个危害类别。研究发现,虽然前沿 LLM 会持续产生有害内容,但它们表现出不同的风险特征,随着模型能力的提高,有害性和多样性也会增加。这表明能力更强的 LLM 可能隐藏着危险的知识,而这些知识被其安全对齐所掩盖。 AI

影响 这项研究提供了一种评估 LLM 安全性的新方法,有望带来更强大的对齐技术,并加深对模型风险的理解。

排序理由 该集群包含一篇研究论文,该论文介绍了一个用于评估 LLM 安全性的新基准数据集。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准数据集揭示前沿大型语言模型中的隐藏风险

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang ·

    HarmProfile:描绘前沿大型语言模型的有害分布

    arXiv:2608.14577v1 Announce Type: cross Abstract: Frontier large language models (LLMs) safety evaluation has largely treated harmful generation as an attack outcome rather than as an object of analysis. Consequently, little is known about the harmful outputs produced during mode…