PulseAugur
实时 10:11:02
实体 RiskAverseOOD

RiskAverseOOD

PulseAugur coverage of RiskAverseOOD — every cluster mentioning RiskAverseOOD across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_143081 ·

    AI风险规避训练显示出对高风险情境的部分泛化能力 · 跟踪1个来源

    一篇新论文介绍了一个名为RiskAverseOOD的基准测试,用于检验在低风险情境下接受风险规避训练的AI模型是否能将这种行为泛化到高风险情境。研究人员发现,尽管训练提高了Qwen3-8B等模型的风险规避能力,但这种泛化能力尚未达到足够一致的程度,不足以作为AI失联的可靠安全保障。该研究强调了在受控环境中训练AI安全并期望所学行为能够迁移到不可预测、高后果情境中的挑战。

  2. TOOL · CL_128753 ·

    AI风险规避可跨越巨大利益进行泛化,但尚不可靠

    研究人员开发了一个新的基准测试RiskAverseOOD,用于测试语言模型如何将风险规避从低风险情景泛化到高风险情景。使用Qwen3、Gemma-3和Llama-3等模型进行各种方法的实验表明,在低风险下学到的风险规避可以在巨大的风险差异中部分泛化。虽然当前模型表现出改进的风险规避行为,但它们尚未达到足够一致的可靠性,不足以作为防止潜在AI错位的安全措施。