一位 Reddit 用户分享了他们使用 Qwen 3.8 27B 模型和 UD-IQ3_XXS 量化在 16GB 显存设置上实现超过 200,000 个 token 上下文的经验。据报道,该设置提供了良好的质量和很少的错误工具调用,尽管与他们之前的 UD-Q3_K_XL 量化相比,提示处理速度从 700-800 tokens/s 降低到 400 tokens/s。该用户使用了一台运行 Windows 11 的 Aorus 5060ti AI Box eGPU 的笔记本电脑。 AI
影响 在消费级硬件上展示了先进的上下文窗口能力,可能降低复杂 AI 任务的门槛。
排序理由 用户分享的特定模型配置的基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →