Reddit r/LocalLLaMA 版块的一名用户报告称,在将 Qwen3.8 27B 模型切换到 Ornith 1.5 35B-A3B 进行本地代理任务时,性能显著提升。Ornith 模型达到了大约 180 tokens/秒,比 Qwen 模型 60 tokens/秒的速度提升了三倍,同时在用户用于工具使用和编码的自定义测试中保持了可比的性能。这种速度提升归因于 Ornith 的架构,该架构每个 token 使用的激活参数数量较少,并采用混合注意力机制限制 KV 缓存增长,从而在性能几乎没有下降的情况下实现更大的上下文窗口。 AI
影响 为本地 AI 代理操作提供了显著的速度提升,有可能在消费级硬件上实现更复杂的任务。
排序理由 用户报告的用于代理任务的本地 LLM 性能对比。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →