PulseAugur
实时 09:16:32

新基准HarmThoughts旨在对LLM推理中的细粒度危害进行检测

研究人员推出了一款名为HarmThoughts的新基准,旨在检测大型语言模型推理过程中细粒度的、句子级别的有害行为。现有的安全评估通常忽略危害是如何在多步推理过程中产生的,只关注最终输出。HarmThoughts通过使用16个行为类别的分类法来标注来自1000多个推理轨迹的超过56,000个句子,从而解决了这一问题。该基准旨在通过分析推理步骤如何促成或缓解有害结果,并评估不同监控方法的有效性,来改进安全监控、干预和故障诊断。 AI

影响 能够更精确地识别和缓解LLM推理过程中出现的有害行为。

排序理由 该集群包含一篇介绍AI安全研究新基准的学术论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准HarmThoughts旨在对LLM推理中的细粒度危害进行检测

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Ishita Kakkar, Enze Zhang, Rheeya Uppaal, Junjie Hu ·

    HarmThoughts:用于细粒度有害行为检测的推理轨迹基准

    arXiv:2604.19001v2 Announce Type: replace Abstract: Large reasoning models (LRMs) produce complex, multi-step reasoning traces, yet safety evaluation remains focused on final outputs, overlooking how harm emerges during reasoning. When jailbroken, harm does not appear instantaneo…