一位用户创建了一个名为“本地大模型竞技场”(Local LLM Arena)的自定义基准测试系统,用于评估在其配备16GB统一内存的M4 MacBook上本地运行的五个不同大语言模型(LLMs)的性能。目标是确定哪些模型最适合在该特定硬件上日常使用,而不是依赖理论基准测试。测试的模型包括 Gemma 4 12B、Ternary Bonsai 27B、GPT-OSS-20B、Qwen3.8-27B 和 Mistral Small 3.2 24B,每个模型都经过36项任务的测试,总计180个测试。该基准测试评估了波兰语质量、推理、文档分析、编程和代理任务等多个方面,同时还测量了速度、内存使用和稳定性。 AI
影响 为消费级硬件上的本地大模型性能提供了实用见解,指导用户在设备端AI应用的选择。
排序理由 用户创建的基准测试系统,用于评估个人硬件上的大模型。
在 Mastodon — sigmoid.social 阅读 →
- Codex
- Gemini Antigravity
- Gemma 4 12B
- GPT-OSS-20B
- M4 MacBook
- Mastodon
- Mistral Small 3.2 24B
- Qwen3.8-27B
- Ternary Bonsai 27B
- MacBook
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →