PulseAugur
实时 10:12:34
实体 TraceSafe-Bench

TraceSafe-Bench

PulseAugur coverage of TraceSafe-Bench — every cluster mentioning TraceSafe-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_193332 ·

    新研究通过自适应护栏和工具使用轨迹基准来解决大语言模型安全问题

    研究人员开发了新方法来增强大语言模型(LLMs)的安全性,解决了其静态性质以及多步工具调用轨迹带来的挑战。其中一个系统SESG展示了一个自适应安全护栏,能在生产环境中自主适应新的威胁,并在数小时内完成,显著减少了人工工作量。另一项开发TraceSafe-Bench提供了一个全面的基准,用于评估大语言模型在中间执行步骤中的安全护栏,揭示了结构数据能力比语义对齐对轨迹安全更关键,并且通用大语言模型通常优于专用安全工具。