一位用户在 Terminal-Bench 2.0 基准测试中测试了 Ternary-Bonsai-27B (2-bit) 和 Bonsai-27B (1-bit) 模型,发现 2-bit 版本取得了 7.9% 的分数。这一性能低于 Qwen3.5-9B 模型,后者也适用于 8GB 显存。1-bit Bonsai 模型在代理场景下由于非终止问题而无法使用,尽管它在简单提示上表现尚可。 AI
影响 展示了极端量化与模型在代理任务中性能之间的权衡。
排序理由 用户在特定框架上对开源模型的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →