PulseAugur
实时 09:32:26
实体 harmful prompts

harmful prompts

PulseAugur coverage of harmful prompts — every cluster mentioning harmful prompts across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_160671 ·

    新的解码方法在高温采样下保留了LLM的拒绝行为

    研究人员开发了一种名为“拒绝门控解码”(Refusal-Gated Decoding)的新解码方法,旨在在高温度采样时保持LLM的安全护栏。该技术旨在提高输出多样性,同时不牺牲模型拒绝有害提示的能力。实验表明,该方法在基准数据集上保留了91-99%的拒绝行为,同时为安全提示保持了高温响应,且延迟增加极少。