进行了一项实验,以确定 AI 实验室是否正在为其模型优化一个特定的非正式基准测试:生成一辆骑自行车的鹈鹕的 SVG。该研究测试了包括 GPT-5.6 Terra 和 Claude Sonnet 5 在内的七个前沿模型,通过生成各种动物-车辆组合的 1008 个 SVG。使用 LLM 裁判和 Gemini 3.1 Flash-Lite 分析的结果表明,实验室并未专门对其模型进行“鹈鹕最大化”,因为在测试模型中,骑自行车的鹈鹕提示的表现并未显著优于其他组合。 AI
影响 表明当前的前沿模型并未针对特定、非正式的基准测试进行优化,这表明其重点在于更广泛的能力。
排序理由 该集群讨论了一项关于 AI 模型在特定非正式基准测试中表现的实验和分析,这属于研究范畴。
- Dylan Castillo
- Pelicanmaxxing
- Taiwan AI Labs
- Claude Sonnet 5
- DeepSeek V4 Pro
- Gemini 3.5 Flash
- GLM-5.2
- GPT-5.6 Terra
- Grok 4.5
- Mastodon
- OpenRouter
- Qwen3.7-Max
- Simon Willison
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →