独立基准测试显示,Qwen3.5 2B(一个非推理模型)在GPQA基准测试中取得了43.8%的成绩。然而,在更复杂的任务上,其表现显著下降,在HLE上仅得5%,在长上下文推理上仅得15%,在SciCode上仅得7.2%。这表明在具有挑战性的评估中存在显著的性能差距。 AI
影响 突出了小型开源模型在复杂推理任务上的性能局限性。
排序理由 开源模型的独立基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →