一位测试AI图像生成模型的开发者发现,Qwen3-VL:32B-Thinking模型是唯一能够跨不同轴提供不同评分的模型,这表明它实际上是在衡量图像,而不是对其进行敷衍了事。虽然Qwen2.5VL:7B和Qwen3-VL:30B-A3B等其他模型产生了持续的评分,但32B模型在幽默和机智方面显示出更广泛的数值范围。此外,32B模型在识别生成图像中的乱码文本方面表现出色,而其他模型在此任务上失败了。然而,32B模型在被要求以JSON格式输出时,出现了一个未记录的bug,返回了一个空字符串。 AI
影响 强调了评估AI模型输出的真正差异性而非一致性评分的重要性,并指出了具体的模型能力和局限性。
排序理由 该条目详细介绍了在特定任务(包括评分和文本识别)上对不同AI模型的比较评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →