PulseAugur
实时 10:41:32
English(EN) CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

新基准CREBench测试LLM在密码逆向工程中的能力

研究人员推出了CREBench,这是一个旨在评估大型语言模型(LLM)在密码二进制逆向工程领域能力的新基准。该基准包含432个挑战,源自标准密码算法和不安全密钥使用场景,难度各异。在评估中,GPT-5.4在八个前沿LLM中表现最强,得分64.03(满分100),在59%的挑战中成功恢复了flag,但人类专家仍以92.19的得分保持显著优势。 AI

影响 该基准可能会推动专门用于安全任务(如漏洞发现和恶意软件分析)的LLM的发展。

排序理由 该集群描述了一个新的学术基准和对LLM在特定任务上的评估,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准CREBench测试LLM在密码逆向工程中的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He ·

    CREBench:评估大型语言模型在密码学二进制逆向工程中的表现

    arXiv:2604.03750v2 Announce Type: replace-cross Abstract: Reverse engineering (RE) is central to software security, particularly for cryptographic programs that handle sensitive data and are highly prone to vulnerabilities. It supports critical tasks such as vulnerability discove…