研究人员推出了一款名为HarmThoughts的新基准,旨在检测大型语言模型推理过程中细粒度的、句子级别的有害行为。现有的安全评估通常忽略危害是如何在多步推理过程中产生的,只关注最终输出。HarmThoughts通过使用16个行为类别的分类法来标注来自1000多个推理轨迹的超过56,000个句子,从而解决了这一问题。该基准旨在通过分析推理步骤如何促成或缓解有害结果,并评估不同监控方法的有效性,来改进安全监控、干预和故障诊断。 AI
影响 能够更精确地识别和缓解LLM推理过程中出现的有害行为。
排序理由 该集群包含一篇介绍AI安全研究新基准的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →