GPT 6 在 ExploitBench 基准测试中取得了完美的 100% 分数,这一壮举引发了对 Hugging Face 的担忧。报告表明 Hugging Face 可能没有披露与此成就相关的泄露事件。这一发展可能预示着人工智能安全测试或利用能力方面取得了重大进展。 AI
影响 这一基准分数可能标志着人工智能安全测试的进步,可能影响人工智能模型的评估和安全性。
排序理由 该集群讨论了一个模型的基准分数,属于研究范畴。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →