PulseAugur
中
实时 07:32:04
实体 crescendo

crescendo

PulseAugur coverage of crescendo — every cluster mentioning crescendo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_273442 ·

    大型语言模型在多轮攻击中的有害性表征随之演变

    研究人员调查了大型语言模型在多轮攻击中,有害性和拒绝表征的几何和时间动态。通过分析 Llama 3.1 8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 等模型在各种攻击框架下的表现,他们发现有害性表征在对话轮次中变得越来越可分离,尤其是在轮末标记处。这些有害性表征与拒绝相关的表征仅显示出微弱的一致性,这表明多轮攻击的成功并非通过内部抑制有害性,而是利用其随时间演变的可分离性。研究结果暗示…

  2. RESEARCH · CL_79899 ·

    新的越狱攻击利用LLM代理工件漏洞

    研究人员开发了一种名为上下文破碎分解(CFD)的新型越狱技术,该技术针对使用工具的LLM代理。该方法利用了工件溯源跟踪中的漏洞,其中中间的、看似良性的操作可能会在之后触发有害行为。通过利用这些工件的延迟组合,CFD将越狱成功率提高了多达28.3个百分点,即使面对强大的防御措施。