发布了一个新的基准测试,比较了Qwen3.8-27b medium、Sol 5.6 high和Qwen3.6-35B模型的性能。该基准测试使用了一个带有拼写错误的提示,要求生成一匹在沙漠中骑着蓝色自行车的马的SVG图像,背景中有一只骆驼,取代了旧的“骑自行车的鹈鹕”测试。 AI
影响 为评估不同语言模型的能力提供了一个新的比较点。
排序理由 该集群描述了一个用于比较LLM性能的新基准测试,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →