PulseAugur
实时 04:42:12
实体 Safety classifiers

Safety classifiers

PulseAugur coverage of Safety classifiers — every cluster mentioning Safety classifiers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_212075 ·

    新方法优化 LLM 评估小组以提高效率和准确性

    一篇新的研究论文提出了一种优化大型语言模型(LLM)评估小组选择和部署的方法。该方法将评判小组设计为一个条件化角色分配问题,根据审计集和成本估算不同评判员的目标相对角色。这形成了一个策略,规定何时删除冗余评判员、添加互补评判员、有条件地路由专家,以及在验证收益减少时停止流程。该方法在推理、代码、安全和数学等多个领域进行了测试,证明了其在创建 LLM 评估的可重用和可审计调用计划方面的有效性。

  2. TOOL · CL_149236 ·

    大型语言模型不确定性量化:黑盒与白盒方法对比

    研究人员正在探索让大型语言模型(LLMs)量化自身不确定性的方法,这对于主动学习和安全分类等应用至关重要。当前的方法分为“白盒”方法,分析内部模型状态但需要访问模型权重;以及“黑盒”方法,依赖于可观察的输出,如 token 及其概率。最近的一项比较评估了八种黑盒技术与一种白盒方法,以确定 LLM 置信度估计的最有效方法。

  3. RESEARCH · CL_43987 ·

    新的攻击方法侵犯了AI安全分类器的隐私

    研究人员开发了一种新的方法来攻击生成式AI系统中使用的安全分类器的隐私。这些分类器在处理诸如自残讨论等敏感数据时被训练,容易受到成员推断攻击(MIA)。新技术针对分类器置信度较低的样本,揭示了模型可能会记住模糊的训练数据。该方法成功恢复了19%的用户痛苦对话,误报率为5%,显著优于现有的MIA方法。