最近对 Qwen3.6 和 Qwen3.5 模型进行的基准测试比较显示,它们在 GeForce RTX 4070 上的推理速度几乎相同,这与最初认为速度显著下降的发现相反。这种差异归因于一个消耗 VRAM 的后台进程,该进程影响了两个模型。在解决了干扰后,Qwen3.6 和 Qwen3.5 都保持了大约每秒 37 个 token 的速度。Qwen3.6 的主要改进体现在需要工具调用、长上下文推理和多轮执行的任务中,在前端生成基准测试中提升超过 40%,而在基于知识的问答任务上的性能仅有边际提升。 AI
影响 Qwen3.6 在工具调用和长上下文推理等智能体任务方面展现出更强的能力,表明在复杂、多步骤的工作负载方面性能更佳。
排序理由 该项目详细介绍了 AI 模型性能的基准测试结果和分析。[lever_c_demoted from research: ic=1 ai=1.0]
- GeForce RTX 4070
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Qwen
- Qwen3.6
- QwenWebBench
- Terminal Bench 2.0
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →