在过去的两年里,Simon Willison 使用了一个独特的基准测试来追踪大型语言模型的进展:生成一个骑自行车的鹈鹕的SVG。最初,模型在处理这项任务时很困难,生成抽象的形状和无意义的解释。然而,到2025年中期,DeepSeek R1和Nvidia的产品等模型显示出显著的改进,有些甚至开始“编辑化”,拒绝提示或添加创意元素。一场使用GPT-4.1 mini作为裁判的比赛揭示了Gemini 2.5 Pro预览版在代码生成和图像合成方面表现出色,凸显了LLM能力的快速发展。 AI
影响 展示了LLM在代码生成和细致任务解释方面的快速进展,可能影响未来的基准测试设计。
排序理由 该项目描述了一个新颖的LLM评估基准测试,并追踪了其随时间的进展,包括具体的模型性能和演变。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude 3.5 Sonnet
- DeepSeek-R1
- Gemini 2.5 Pro
- Gemini 3
- GPT-4.1 mini
- Llama 3.3-70B
- Mistral Small 3
- Nvidia
- Qwen2.5 Coder
- Qwen3-4B-Thinking
- Simon Willison
- SVG
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →