Sakana AI 推出了 Fugu-Cyber,一个专门针对网络安全任务进行调优的编排模型。该模型在 CyberGym 基准测试中取得了 86.9% 的成绩,在 CTI-REALM 基准测试中取得了 72.1% 的成绩,使其成为与 GPT-5.5-Cyber 和 Claude Mythos Preview 等其他专业模型竞争的有力选项。Fugu-Cyber 在 Sakana 的 Fugu orchestrator 中运行,该 orchestrator 将任务委托给专业模型,并特别强调以安全为重点的验证步骤。 AI
影响 这个专门的网络安全模型设定了新的基准,可能会影响安全任务 AI 代理的开发。
排序理由 Sakana AI 是一个前沿实验室,发布了一个具有基准测试结果的新模型。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Claude Mythos Preview
- Conductor
- CTI-REALM
- Fugu
- Fugu-Cyber
- GPT-5.5-Cyber
- ICLR 2026
- KQL
- Microsoft
- MITRE ATT&CK
- Sakana AI
- Sigma
- TRINITY
- UC Berkeley
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →