一位 r/LocalLLaMA 用户质疑 Artificial Analysis 上的基准测试覆盖范围,指出 Qwen 32B 和其他本地模型缺失,而较新的“前沿”模型却被优先考虑。用户怀疑该平台的选择过程存在以美国为中心偏见和缺乏中立性。他们正在寻找其他更可靠、更透明的基准测试网站,认为 LLM-Stats.com 不可信。 AI
影响 引发了对人工智能模型基准测试平台透明度和中立性的质疑。
排序理由 用户对人工智能模型基准测试覆盖范围和感知偏见的评论。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →