PulseAugur
实时 20:38:51
English(EN) Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

新框架 MalEval 评估大型语言模型在恶意软件审计方面的能力

一项新的研究论文介绍了一个名为 MalEval 的框架,该框架旨在评估大型语言模型(LLMs)在审计恶意软件行为方面的能力。该框架解决了诸如缺乏人类编写的真实情况、上下文窗口限制以及难以根据代码证据验证 LLM 生成的声明等挑战。MalEval 使用专家编写的审计报告和面向上下文的中间表示,以实现对 LLM 输出的分阶段验证,揭示了当前模型通常依赖于表面线索而非可验证的证据。 AI

影响 该框架可以提高 LLM 驱动的安全分析工具的可靠性和可验证性。

排序理由 该集群包含一篇详细介绍 LLM 新评估框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架 MalEval 评估大型语言模型在恶意软件审计方面的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro ·

    “知道其恶意是否足够?”评估大型语言模型以进行细粒度恶意软件行为审计

    arXiv:2509.14335v2 Announce Type: replace-cross Abstract: Automated malware classifiers achieve strong detection performance, but auditing requires more than flagging a sample: analysts must explain malicious behaviors and justify them with code evidence. Traditional signature-ba…