GPT-Red
PulseAugur coverage of GPT-Red — every cluster mentioning GPT-Red across labs, papers, and developer communities, ranked by signal.
- 2026-07-17 product_launch OpenAI has developed a new large language model named GPT-Red. 来源
- 2026-07-15 research_milestone OpenAI introduces GPT-Red, an automated red-teaming system to improve AI model safety and resilience. 来源
- 2026-07-15 product_launch OpenAI has introduced GPT-Red, an AI system designed for automated red teaming to improve AI safety and robustness. 来源
- 2026-07-15 research_milestone OpenAI developed GPT-Red, an AI model designed to automatically find vulnerabilities in other AI models through self-play. 来源
-
OpenAI 的 GPT-Red 模型发现 AI 漏洞,但不能保证代理安全
OpenAI 开发了 GPT-Red,一个旨在迭代攻击其他 AI 模型并为其训练生成对抗性数据的 AI 模型。虽然 GPT-Red 在发现漏洞方面取得了显著成功,尤其是在间接提示注入场景中,其表现优于人类,但其报告的低失败率(例如,在直接攻击中为 0.05%)不应直接推断为已部署 AI 代理的安全保证。GPT-Red 的有效性取决于其运行的具体基准和规则集,而这些并不能完全捕捉涉及外部工具和数据访问的真实代理环境的复杂性和潜在风险。
-
人工智能实验室争夺2026年网络安全军备竞赛
文章推测了未来人工智能网络安全军备竞赛的景象,设想了各大AI实验室将采取的不同方法。据称,OpenAI正在开发一种能够自我入侵的人工智能,而Google则在研发一种能够预先修补系统漏洞的人工智能。Anthropic对这一假想场景的贡献也被提及,但提供的片段中细节并未完全阐述。
-
新的GPT-Red代理可自动执行LLM红队测试,表现优于人类
研究人员开发了GPT-Red,这是一种旨在发现针对大型语言模型的提示注入攻击的自动化代理。该代理使用可扩展的自我博弈算法进行训练,并且在与人类红队测试人员的比较中表现出卓越的性能,成功攻破了之前的模型,如GPT-5.5。GPT-Red的开发是旨在增强前沿LLM鲁棒性工作的一部分,预计更强大的模型将反过来促进创建更强大的红队测试代理,从而促进AI安全性的持续改进循环。
-
提示注入防御需要不断重新测试,因为LLM攻击不断演变
提示注入防御必须被视为回归测试,每次模型更新时都要重新运行,因为新的攻击类别不断涌现且模型行为会发生变化。像OpenAI的GPT-Red这样的自动化攻击者可以发现新的漏洞,例如快速演变的Fake Chain-of-Thought。开发人员无法控制模型的内部抵抗力,但可以实施输入防火墙和输出验证层来减轻风险。
-
OpenAI、Moonshot、Anthropic 发布旗舰模型;基准测试显示各有千秋
OpenAI、Moonshot AI 和 Anthropic 公司迅速发布了各自最新的旗舰模型:GPT-5.6 Sol、Kimi K3 和 Claude Opus 5。这三款模型都提供了巨大的上下文窗口和有竞争力的定价,但性能基准测试揭示了细微的差异。Claude Opus 5 在 SWE-bench Pro 等编码任务和 ARC-AGI-3 等推理基准测试中表现领先,而 GPT-5.6 Sol 在智能终端任务以及 DeepSWE 1…
-
通过“GPT-Red”探索有偏见的 AI 概念
文章讨论了“GPT-Red”的概念,这是一种假设情景,即像 ChatGPT 这样的 AI 可能表现出反映人类偏见的偏见或局限性。它探讨了这种 AI 行为对用户和社会可能产生的潜在影响,促使人们反思人工智能的开发和伦理考量。
-
OpenAI 开发 GPT-Red,探索智能音箱;Anthropic 为教师提供免费 Claude
据报道,OpenAI 已开发出名为 GPT-Red 的自动化红队测试工具,并正在探索创建无屏智能音箱。与此同时,Anthropic 正为教师提供其 Claude 模型免费访问权限,并已调整其 Claude Fable 5 的开发计划。
-
OpenAI 训练“超级黑客”AI 以加强模型防御;PsiQuantum 计划开发基于光的量子计算机
OpenAI 开发了一个名为 GPT-Red 的新 LLM,旨在充当“超级黑客”。该 AI 正在针对 OpenAI 自家的模型进行训练,以识别和加强其防御网络攻击的能力。另外,PsiQuantum 宣布了利用光的大规模量子计算机计划,这可能会显著提升计算能力。
-
OpenAI 发布 GPT-Red LLM;马斯克收购燃气轮机公司以支持 Grok
OpenAI 开发了一个名为 GPT-Red 的新大型语言模型,被描述为“超级黑客”AI。这一进展在每日科技通讯《The Download》中得到强调。该通讯还注意到美国热泵的日益普及以及埃隆·马斯克收购一家燃气轮机公司以支持 Grok。
-
OpenAI开发GPT-Red AI以加强模型安全
OpenAI开发了一个名为GPT-Red的新AI模型,旨在充当“超级黑客”,以增强其其他AI系统的安全性和保障性。该模型自动化了红队测试流程,识别出人类测试人员可能忽略的漏洞和潜在的利用方式。此举旨在使OpenAI的模型能够抵御不断演变的网络威胁。
-
OpenAI 使用 AI 发现 AI 漏洞,超越人类测试者
OpenAI 正在使用其内部的 GPT-Red 模型来识别其自身 AI 系统的漏洞,在模拟攻击中取得了 84% 的成功率。这种由 AI 驱动的方法显著优于人类红队测试人员,后者仅取得 13% 的成功率。从这些由 AI 主导的安全测试中获得的见解对于增强 GPT-5.6 Sol 等未来模型的鲁棒性至关重要。
-
OpenAI 发布 GPT-Red 用于规模化 AI 安全测试 · 已追踪 5 个来源
OpenAI 推出了 GPT-Red,一个内部自动化系统,旨在大规模识别其 AI 模型中的提示注入漏洞。该系统通过对抗性自我博弈进行学习,在此过程中它会尝试利用防御模型,并利用成功的攻击来改进未来的模型。OpenAI 报告称,针对 GPT-Red 的训练已使其 GPT-5.6 Sol 模型具有显著的更强韧性,在面对提示注入攻击时,其故障率比之前的生产模型低六倍。
-
OpenAI 的 GPT-Red AI 黑客发现漏洞能力胜过人类 · 追踪 8 个来源
OpenAI 开发了一个名为 GPT-Red 的 AI 模型,旨在充当“超级黑客”,以识别和利用其他 AI 模型中的漏洞。这个自动化的红队测试系统使用自我对抗循环,GPT-Red 攻击其他模型,而其他模型则进行防御,从而提高鲁棒性。OpenAI 表示,GPT-Red 已发现新的提示注入攻击,包括“伪造思维链”漏洞,并且在识别弱点方面比人类红队测试人员更有效,成功率为 84%,而人类为 13%。
-
OpenAI发布GPT-Red以提升AI安全,研究探索自我改进
OpenAI推出了GPT-Red,一个旨在通过自我对抗来增强AI安全性和鲁棒性的自动化系统,特别针对提示注入漏洞。同时,一篇研究论文提出了一种用于大型模型的“启蒙式”微调方法,该方法在不更新权重的情况下修改模型捷径,以解锁潜在能力并提高在各种基准测试中的性能。Reddit上的讨论突出了这些进展,一些用户将其视为AI递归自我改进的首次实验证据。