Ling 3.0,Ling 语言模型的新迭代版本,已在 Strix Halo 硬件上进行了演示运行。该版本利用 vLLM 配合 ROCm/HiP 和 4 位压缩张量(int4)以提升性能。初步比较表明,当 Ling 3.0 和 Qwen-122b 都针对各自格式进行优化时,Ling 3.0 的速度显著优于 Qwen-122b,但工具调用功能在某些环境中被指出存在问题。 AI
影响 展示了在专用硬件上实现更快推理的潜力,影响本地 LLM 的部署。
排序理由 这是关于特定语言模型在新硬件上性能的研究级更新,并非来自主要实验室的前沿发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →