一位用户详细介绍了一个利用两块 Tesla P40 GPU 进行文学书籍翻译的双模型流水线。该流水线使用 Gemma 4 - 26B-A4B 进行翻译,速度约为每秒 40 token,并使用 Qwen3.6 35B-A3B 进行校对,速度为每秒 50-70 token。该设置利用了多 token 预测 (MTP) 推测解码和 64K 上下文窗口,以实现高效、大批量的整本书翻译。 AI
影响 展示了针对书籍翻译等专业、大批量任务的高效本地 LLM 部署。
排序理由 用户开发的工具和推理设置详情。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →