一位用户通过让 Qwen 3.8-27B 模型参加 ACT 标准化考试来对其进行测试,在一项测试中取得了 36 分的综合分数,在另一项测试中取得了 34 分。该模型正确回答了 342 个问题中的 326 个,表现强劲,尤其是在阅读部分,它取得了满分。考试耗时约 177 分钟,用户指出该模型使用视觉能力处理 PDF 文档是导致耗时较长的原因。 AI
影响 展示了特定大型语言模型在复杂的多部分标准化考试中表现的能力。
排序理由 用户驱动的特定模型版本在标准化考试上的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →