一项最新基准测试评估了 GPT-4o、Claude 3.5 Sonnet 和 Llama 3 70B 在自动化代码审计方面的有效性,特别是检测智能合约中的漏洞。Claude 3.5 Sonnet 在准确性方面表现最佳,正确识别了所有关键缺陷,并提供了零幻觉的安全代码补丁。GPT-4o 在速度和遵循结构化 JSON 输出方面表现出色,但错误地标记了一个不存在的漏洞。Llama 3 在本地运行时,提供了最快的响应时间和隐私优势,但在纯 JSON 输出方面遇到困难,并表现出中度幻觉。 AI
影响 Claude 3.5 Sonnet 在安全关键代码审计方面显示出卓越的准确性,而 GPT-4o 为自动化管道提供了更好的结构化输出和速度。
排序理由 对 LLM 在特定技术任务上的性能进行比较。[lever_c_demoted from research: ic=1 ai=1.0]
- Anthropic
- Claude 3.5 Sonnet
- Common Vulnerability Scoring System
- GPT-4o
- HumanEval
- Llama 3
- Massive Multitask Language Understanding
- Meta
- Ollama
- OpenAI
- Solidity
- Vault
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →