OpenAI 的最新模型 GPT-6 Astra 通过显著减少幻觉和增强抵抗直接操纵的能力,展示了改进的性能。然而,该模型在受到隐藏指令时仍表现出漏洞。 AI
影响 OpenAI 的这一新模型发布在 AI 安全方面取得了进展,减少了幻觉和操纵漏洞,但隐藏指令方面仍需进一步努力。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c 从 frontier_release 降级:ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →