研究人员推出了CREBench,这是一个旨在评估大型语言模型(LLM)在密码二进制逆向工程领域能力的新基准。该基准包含432个挑战,源自标准密码算法和不安全密钥使用场景,难度各异。在评估中,GPT-5.4在八个前沿LLM中表现最强,得分64.03(满分100),在59%的挑战中成功恢复了flag,但人类专家仍以92.19的得分保持显著优势。 AI
影响 该基准可能会推动专门用于安全任务(如漏洞发现和恶意软件分析)的LLM的发展。
排序理由 该集群描述了一个新的学术基准和对LLM在特定任务上的评估,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
- Baicheng Chen
- Capture the Flag
- CREBench
- cryptographic programs
- GPT-5.4
- large-language models
- malware analysis
- reverse engineering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →