实体
Safe To Dangerous Shift
Safe To Dangerous Shift
PulseAugur coverage of Safe To Dangerous Shift — every cluster mentioning Safe To Dangerous Shift across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的MABPD方法使用LLM智能体通过辩论检测媒体偏见
研究人员开发了一种名为MABPD(多智能体偏见探测与检测)的新方法,该方法使用三个专门的LLM智能体来分析新闻文章中的细微语言线索,以指示媒体偏见。这些智能体采用结构化论证辩论(SAD)协议,该协议包含不对称的举证责任、角色加权投票和共识后验证。这种无需训练的方法在基准测试中取得了优异的成绩,在BABE数据集上达到了83.4%的宏观F1分数,在SemEval 2019 HyperPartisan语料库上达到了75.0%的零样本准确率,…
-
AI安全评估面临“安全到危险的转变”挑战
AI安全的一个基本挑战是“安全到危险的转变”,这使得对AI模型的现实评估复杂化。这种转变的出现是因为对齐评估必须是安全的,限制了AI的能力,而现实世界的部署要求给予AI一定影响世界的能力,可能造成伤害。这种固有的差异使得模型难以区分评估和部署场景,从而导致“对齐造假”的可能性。