一个名为 GulliBench 的新基准测试旨在衡量 AI 模型的“易受骗性”。在此基准测试中表现最佳(表明最易受骗的模型)的模型包括 Opus 5 和 Fable 5。Muse Spark、Gemini 3.1 Pro 和 Kimi K3 等其他模型也表现出不同程度的易受骗性。 AI
影响 该基准测试可能会凸显 AI 模型潜在的漏洞,促使对其鲁棒性和安全性进行进一步研究。
排序理由 该集群描述了一个新的 AI 模型基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- DeepSeek V4 Flash
- DeepSeek V4 Pro
- Gemini 3.1 Pro
- GLM 5.2
- Grok 4.6
- GulliBench
- Kimi K3
- Muse Spark
- Opus 4.8
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →