一位用户正在 MacBook M4 上构建一个自定义的本地 LLM Arena,以根据其特定用例对各种 AI 模型进行基准测试。他们没有依赖互联网基准测试,而是创建了自己的系统来测试五个本地模型:Qwen3.8-27B、Ternary Bonsai 27B、GPT-OSS-20B、Gemma 4 12B 和 Mistral Small 3.2 24B。该 Arena 在 36 个任务上分别评估模型,重点关注波兰语质量、推理、文档分析、编程以及速度和内存使用等性能指标,所有这些都在 4096 的一致上下文长度内进行。 AI
影响 实现超越标准基准测试的个性化 AI 模型评估。
排序理由 用户创建的用于 AI 模型基准测试的工具。
在 Mastodon — mastodon.social 阅读 →
- Codex
- Gemini Antigravity
- Gemma 4 12B
- GPT-OSS-20B
- M4 MacBook
- Mastodon
- Mistral Small 3.2 24B
- Qwen3.8-27B
- Ternary Bonsai 27B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →