对 Step3 VL 10B 模型的新评估显示,该模型在不同基准测试中存在显著的性能差异。该模型在 GPQA 基准测试中获得了 69% 的分数,表明其在研究生水平的问答方面表现强劲。然而,在长上下文推理任务上,其得分仅为 0%,凸显了其在处理扩展信息方面的关键弱点。 AI
影响 突出了 Step3 VL 10B 模型在长上下文推理方面的特定弱点,指出了未来发展的方向。
排序理由 该集群报告了某 AI 模型的基准测试结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →