一项新的基准测试 CryptanalysisBench 已被开发出来,用于评估大型语言模型 (LLM) 在执行数学密码分析方面的能力。早期结果表明,Anthropic 的前沿模型已展示出利用此基准测试发现新攻击的能力。 AI
影响 该基准测试可能会揭示 LLM 的漏洞,并为开发更安全的人工智能系统提供信息。
排序理由 该集群讨论了一个用于评估 LLM 在密码分析能力方面的新学术基准测试。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →