Kimi K2.5 在包括 GPQA、HLE、长上下文和 SciCode 在内的多个基准测试中取得了显著的性能。该模型在这些评估中的定价具有竞争力,每美元 30 个整数点。这些结果是独立测量和发布的。 AI
影响 在关键的 LLM 基准测试中展示了具有竞争力的性能和成本效益。
排序理由 模型基准测试结果由独立测量来源发布。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →