Sarvam AI 发布了其 Sarvam 30B 模型,目前已公布多个基准测试的性能指标。该模型在 GPQA 上达到 63.3%,在 Humanity's Last Exam 上达到 7.5%,在 SciCode 上达到 19.2%。值得注意的是,它在长上下文推理任务上得分为 0%,并且其成本效益以每美元 136.2 智能点突出显示。 AI
影响 提供了 Sarvam 30B 模型的基准数据,有助于将其能力与其他大型语言模型进行比较。
排序理由 该条目报告了一个开源大型语言模型的基准测试结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Humanity's Last Exam
- long-context reasoning
- SciCode
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →