PulseAugur
实时 14:41:26
Français(FR) Rapport de risque d'Anthropic : modèle secret, déficit de protection sur 133 M de conversations et évaluations en panne

Anthropic 提高 AI 风险评级,披露秘密模型,并公布安全漏洞 · 跟踪 2 个来源

Anthropic 最新发布的风险报告显示,其对齐不当和生物武器风险的评估显著增加,均从“非常低”升至“低”。该报告还披露了一个内部模型“Model 2”,该模型在多项基准测试中表现优于公开的 Claude Mythos 5,但由于部署前评估不完整而未发布。一项关键发现是,一项针对生物武器滥用的安全措施在约 11 个月内被意外禁用,影响了约 1.33 亿次对话,且未被记录。 AI

影响 凸显了评估前沿 AI 安全性日益增长的难度,以及内部模型超越公开模型的潜力。

排序理由 公司自行发布的风险报告,详细说明了内部模型性能和安全故障。

在 dev.to — Anthropic tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

Anthropic 提高 AI 风险评级,披露秘密模型,并公布安全漏洞 · 跟踪 2 个来源

报道来源 [2]

  1. dev.to — Anthropic tag TIER_1 Français(FR) · DrMBL ·

    Anthropic风险报告:秘密模型、1.33亿次对话的保护缺陷以及评估失败

    <p><strong>TL;DR :</strong> Le 14 août, Anthropic a publié son deuxième rapport de risque à l'échelle de l'entreprise — et s'en est servi pour relever ses propres niveaux de risque. Le risque de désalignement et le risque lié aux armes chimiques/biologiques sont tous deux passés …

  2. dev.to — Anthropic tag TIER_1 English(EN) · DrMBL ·

    Anthropic的风险报告:一个秘密模型、一个1.33亿次对话的安全漏洞,以及失效的评估

    <p><strong>TL;DR:</strong> On August 14, Anthropic published its second company-wide Risk Report — and used it to raise its own risk ratings. Misalignment and chemical/biological-weapon risk both moved from "very low" to "low," a bioweapon safeguard was found to have sat silently…