一位用户汇编了一个包含来自不同 Qwen 模型输出的综合数据集,共计 1109 个示例。该集合旨在提供一个资源,用于比较不同 Qwen 版本在 35 个提示下的性能。该数据集可通过一个专用网站访问,允许用户探索和分析 Qwen 3.7、Qwen 3.6 和 Qwen 3.5 等模型的测试结果。 AI
影响 提供了一个用于评估 Qwen 模型性能的比较数据集。
排序理由 用户生成的多个模型版本比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →