Qwen3 Omni 30B A3B Instruct 模型在特定基准测试中表现强劲,GPQA 达到 62%,MMLU-Pro 达到 72.5%。然而,它在长上下文推理方面没有表现出任何能力。根据独立测量,该模型运行速度为每秒 108.2 个 token,每美元提供 14 个“智能点”。 AI
影响 该模型的性能表明了当前 LLM 能力的优势和劣势,特别突出了长上下文推理的挑战。
排序理由 该项目报告了 AI 模型的具体基准测试结果,属于研究范畴。[lever_c_从研究降级:ic=1 ai=1.0]
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →